Откриване на безтегловни невронни мрежи и еволюцията на дълбокото обучение

  • Дълбокото обучение използва многослойни архитектури за обработка на сложни данни, използвайки тегла и активиращи функции.
  • Безтегловните невронни мрежи заместват скъпите математически умножения с двоични таблици за търсене.
  • Тази нова архитектура позволява драстично намаляване на консумацията на енергия и размера на моделите за периферни устройства.

Системи за невронни мрежи

Ако някога сте се чудили как една машина може да разпознае лицето ви или да разбере какво казвате, отговорът се крие във очарованието от човешкия мозък. Тези биологични структури, съставени от взаимосвързани неврони, които предават електрически сигналиТе са послужили като план за създаването на това, което днес познаваме като изкуствени невронни мрежи, които са основно алгоритми, предназначени за решаване на сложни математически пъзели.

В днешния свят сме свикнали изкуственият интелект да е синоним на суперкомпютри и огромна консумация на енергия. Очертава се обаче една много интересна тенденция, която се стреми да... оптимизиране на енергийната ефективностпоставяйки под въпрос дали наистина трябва да обработим милиони умножения, за да получим прост отговор, като по този начин имитираме енергийната трезвеност на собствения си мозък.

аналогови изчисления
Свързана статия:
Аналогови изчисления в паметта: залогът за намаляване на консумацията на енергия от изкуствения интелект

Класическа архитектура: от перцептрона до дълбокото обучение

За да разберем накъде отиваме, трябва да знаем откъде сме дошли. Една основна невронна мрежа обикновено е организирана на три нива. Всичко започва от входен слойТова е мястото, където системата получава данни отвън, анализира ги и ги изпраща напред. След това идва ред на скрити слоевекоито могат да бъдат една или десетки; тук се извършва истинската обработка, като информацията се прецизира на всеки етап.

Накрая стигнахме до изходен слойкоето ни дава окончателната присъда. В зависимост от това какво търсим, може да имаме един възел за отговор „да“ или „не“ (бинарна класификация) или няколко възела, ако проблемът е по-сложен и изисква избор между множество категории.

Когато говорим за това Дълбоко обучениеГоворим за мрежи с много скрити слоеве и милиони връзки. В този модел връзката между невроните се определя от числова стойност, наречена теглоПроблемът е, че тези мрежи са консуматори на данни и енергия, изискващи милиони примери, за да се избегнат грешки.

AIoT
Свързана статия:
AIoT: какво е това и как се различава от конвенционалния IoT?

Сърцевината на обучението: Разпространение напред и назад

За да може една мрежа да се учи, тя първо трябва да се опита да познае. Процесът на Предно разпространение Това е основно пътуване отляво надясно: данните постъпват, умножават се по теглата, добавя се корекция, наречена отклонение, и преминават през активираща функция (като Sigmoid или ReLu), за да се реши дали невронът „се задейства“ или не.

Но тъй като мрежата не знае нищо в началото, тя ще се провали по грандиозен начин. Тук е мястото, където Обратно разпространениеи тук се случва магията. Алгоритъмът сега се движи отдясно наляво, изчислявайки грешката между получения резултат и действителния резултат. Използвайки математически производниМрежата коригира теглата, за да минимизира тази грешка в следващата итерация.

Ключов детайл в този процес е скорост на обучениеАко е твърде висока, мрежата се учи бързо, но е неточна; ако е твърде ниска, процесът става безкраен. Крайната цел е да се достигне глобалният минимум на функцията на разходите, което позволява на мрежата да обобщава информацията правилно.

Революцията на безтегловните невронни мрежи

Тук нещата стават вълнуващи. Професор Лизи К. Джон и нейният екип разчупват стереотипите, като предлагат безтегловни невронни мрежиДокато конвенционалният изкуствен интелект разчита на извършването на милиарди умножения (много скъпа операция за хардуера), този подход използва взаимосвързани таблици за търсене.

Вместо да изчислява сложна аритметична операция, мрежата просто проверява съхранен отговор, базиран на двоични входове. Това е система, много по-подобна на начина, по който хората разсъждават: ние не умножаваме числата наум, за да решим дали да вървим наляво или надясно, а по-скоро... обработваме сигналите за активиране.

Raspberry Pi AI HAT+ 2
Свързана статия:
Raspberry Pi AI HAT+ 2: новият залог за извеждане на генеративния изкуствен интелект на ръба

Резултатите са просто зашеметяващи. В задачи като медицинско наблюдение (ЕКГ или ЕЕГ) или разпознаване на ключови думи, тези мрежи могат да бъдат хиляда пъти по-малък и по-ефективенПредставете си, че преминавате от 17-мегабайтов модел към такъв от само 14 килобайта. Това позволява на изкуствения интелект да живее директно в сензора чрез EdgeComputing без да е необходимо да изпращате данни в облака, което също е Аргумент в полза на поверителността на потребителя.

Към устойчив и лек изкуствен интелект

Не става въпрос само за премахване на килограмите; има и тенденция за... леки невронни мрежиТе са проектирани да консумират възможно най-малко количество енергия и памет, използвайки техники като оскъдно обучение или подрязванекоето се състои в елиминиране на връзки, които не допринасят с нищо за крайния резултат.

Този подход е жизненоважен в сектори като управление на енергията в сгради или охлаждане на центрове за данни, където оптимизирането на потреблението може да означава икономия на енергия до 30%Целта е ясна: изкуственият интелект да не е климатичен проблем, а част от решението, което ще позволи създаването на евтини устройства, като например... ARM Cortex микроконтролери, изпълняват интелигентни задачи в реално време.

От трансформаторите, които захранват съвременните чатботове, до фокусираните върху изображения конволюционни невронни мрежи (CNN), пътят към ефективността води през намаляване на изчислителната сложностСкокът от класическия перцептрон към генеративния изкуствен интелект беше огромен по отношение на данни и мощност, но истинският авангарден подход сега се стреми да прави повече с много по-малко ресурси.

Преходът от плътни, силно умножаващи архитектури към системи, базирани на двоично търсене и модели с намален брой елементи, прави изкуствения интелект жизнеспособен на малки устройства. Чрез интегриране на енергийна ефективност и математическо опростяване, обработката на данни става драстично по-бърза и по-устойчива, проправяйки пътя за локални, частни изчисления, които вече не разчитат на масивни графични процесори, за да функционират правилно.

хиперспектрална камера с изкуствен интелект
Свързана статия:
Хиперспектрална камера с изкуствен интелект: реални приложения и технологии

Добавяне като предпочитан източник в Google