Пълно ръководство за LLM на ръба с Raspberry Pi

  • Внедряване на модели на малък език (SLM) и модели на визуален език (VLM) за локална обработка.
  • Оптимизация на хардуера чрез използването на Raspberry Pi 5, активно охлаждане и NVMe съхранение.
  • Използване на инструменти като Ollama и Llama.cpp за изпълнение на квантовани модели във формат GGUF.
  • Интеграция на изкуствен интелект в периферията за приложения в домашната автоматизация, индустриалната сигурност и анализа на лични данни.

Изкуствен интелект на Raspberry Pi

Вероятно сте се чудили дали е възможно да имате мощен изкуствен мозък, без да разчитате на работещите сървъри на голяма компания в Съединените щати. Отговорът е категорично „да“ и нещо повече, днес това е възможно. модели на език за изпълнение В устройство, толкова компактно като Raspberry Pi, то е престанало да бъде експеримент за маниаци и се е превърнало в жизнеспособна и изненадващо ефективна техническа опция.

Магията се случва благодарение на периферните изчисления или крайни изчислениякоето основно се състои в обработка на информацията точно там, където е генерирана. Чрез преместването на изкуствения интелект към устройството, ние даваме възможност на поверителността на данните бъдете абсолютни, тъй като нищо не напуска дома, и ние елиминираме това разочароващо забавяне, което възниква, когато данните трябва да пътуват хиляди километри, преди да получат отговор.

важност на актуализациите в iot-2
Свързана статия:
Отворен код в Интернет на нещата: платформи, данни и периферен изкуствен интелект, които правят разликата

Идеалният хардуер за локален изкуствен интелект

Ако искате да се забъркате в тази каша, не всеки регистрационен номер ще ви свърши работа. Raspberry Pi 5 Това е перфектният кандидат благодарение на процесора си Arm Cortex-A76, истински звяр за справяне със задачи за извод. За да се гарантира, че преживяването не е мъчение, е важно да имате модела на 8GB на RAM, тъй като квантуваните модели консумират значително количество RAM А операционната система се нуждае от въздух, за да диша.

Една област, в която много хора допускат грешки, е температурата. LLM изводът натоварва ядрата до 100%, което води до бързо нагряване на процесора. За да се предотврати спадане на производителността на системата поради това, термично дроселиране, на Официален активен охладител Това не е допълнителен аксесоар, а е задължително. Ако не искате вашият Pi да се превърне в тостер, ви е необходима активна вентилация.

Що се отнася до паметта, макар че microSD карта клас A2 ще е достатъчна, ако искате моделите да се зареждат за миг, най-добре е да използвате NVMe SSD използвайки M.2 HAT. Разликата е огромна: зареждането на 2GB модел може да отнеме от 12 секунди до само 3 или 4, което ускорява внедряването на всяко приложение на ръба.

Arm разширява програмата си за лицензиране на изкуствен интелект
Свързана статия:
Arm разширява гъвкавия достъп за лицензиране на ИИ в периферията

Разбиране на SLM и количествено определяне

Забравете за опитите да стартирате GPT-4 на Raspberry Pi; това би било все едно да се опитвате да вкарате слон в компактна кола. Ето къде... Модели на малки езици (SLM)Тези модели, които обикновено имат между няколкостотин милиона и 7 или 8 милиарда параметъра, са специално проектирани за устройства с ограничени ресурси, без да губят твърде много кохерентност.

Главният трик, за да се получи това, е Количествено определяне на GGUFПо принцип това включва намаляване на прецизността на теглата на модела (например от 16 бита на 4 бита). Това прави модела да заема много по-малко RAM памет и скорост на генериране Броят на жетоните е приемлив, което позволява скорости на четене, удобни за човек.

  • Лама 3.2 (1B и 3B): Идеален за многоезични диалози и задачи за обобщаване.
  • Джема 3 и 3n: Те се открояват със своята ефективност, а в някои версии и с визуални възможности.
  • Microsoft Phi-3.5: Много силен в разсъжденията си, въпреки че понякога може да бъде твърде многословен.
  • Малката Лама: Кралят на скоростта, перфектен за прости команди за домашна автоматизация.

Инструменти за внедряване: Ollama и Llama.cpp

За да осъществим всичко това, имаме два основни пътя. От една страна, Call.cpp Това е опцията за тези, които искат пълен контрол. Тя ви позволява да компилирате изходния код, като оптимизирате инструкциите на ARM NEON и dotprod, извличайки и последната капка мощност от силиция. Идеална е за излагане на... OpenAI съвместим API на порт 8080 и свържете Pi към други устройства в локалната мрежа.

От друга страна имаме Оламакоето е може би най-лесният начин за управление на модели днес. С няколко команди в терминала можете да изтеглите и стартирате модели като Llama или листна пъпка Без усложнения. Олама настройва сървър във фонов режим, който позволява взаимодействие с изкуствения интелект чрез... библиотека на python много интуитивен, което улеснява създаването на персонализирани скриптове.

За оптимизиране на системата, особено в Lite версиите на Raspberry Pi OS, е жизненоважно увеличаване на пространството за суап до около 4GB. Това предотвратява прекратяването на процеса от OOM Killer (Out Of Memory - липса на памет), когато моделът на чата и контекстът започнат да запълват наличната RAM памет.

локални AI агенти в esp32
Свързана статия:
Локални AI агенти на ESP32: рамки, проекти и ограничения

Модели за зрение и език (VLM) на периферията

Нещата стават наистина интересни, когато комбинираме зрението с думите. Модели на визуално-езиковото мислене (VLM) Те позволяват на Raspberry Pi не само да чете, но и да разбира изображения. Модели като Лунен сън Те са изненадващо бързи и способни да описват сцени, да броят обекти или да извършват OCR директно на устройството.

Практичен и много силен пример е използването на Raspberry Pi с изкуствен интелектВместо да изпраща сурово видео към облака, камерата обработва изображението на сензора и генерира метаданни (като етикети на обекти и нива на доверие). Тези леки данни се изпращат към LLM, който ги преобразува в четливи резюмета За хората. Това е разликата между изпращането на видеоклип от 1 GB или текстов файл от 1 KB.

Този подход отваря вратата към приложения като мониторинг на рафтовете В търговията на дребно, където системата предупреждава за липса на стоки, или при наблюдение на фабрики, за да се провери дали операторите носят предпазни средства. оборудване за безопасностВсичко това, като същевременно се запазва поверителността и се спазват разпоредбите на GDPR, като не се качват изображения на външни сървъри.

Случаи на употреба и автоматизация в реалния свят

Ако се занимавате с домашна автоматизация, можете да превърнете вашия Pi в... местен контролен центърПредставете си гласов асистент, който използва Whisper.cpp, за да транскрибира гласа ви, и локален LLM, за да анализира намерението в JSON, което след това задейства действия в Home Assistant. Всичко това се случва за милисекунди и... Няма интернет връзка.

В индустриални условия тези системи могат да се използват за Прогнозна поддръжка или оптимизация на процесите в реално време. Те са и чисто злато за прецизното земеделие, където мобилно устройство може да анализира здравето на реколтата в средата на полето, без да е необходимо 5G покритие.

От образователни инструменти в отдалечени райони до асистенти за хора с увреждания, способността за изпълнение генеративен изкуствен интелект на ръба Това демократизира достъпа до технологии и позволява създаването на хиперспециализирани решения, които не зависят от месечна такса за абонамент за облак.

Възможността за локална обработка на език и визуални данни на платка за 80 евро е огромен технологичен скок. Чрез комбиниране на оптимизиран хардуер, квантовани модели и инструменти като Ollama, всеки разработчик може да изгради бърза, ефективна и частна екосистема от изкуствен интелект, която е наистина полезна във физическия свят.

edgecortix-sakura-ii AI
Свързана статия:
EdgeCortix SAKURA-II Edge AI ускорител с 60 TOPS и само 8W

Добавяне като предпочитан източник в Google