О так, це все ще повторюється у 3.1.
405b це для великих обчислювальних потужностей, 70b можна запустити, 8b працює чудово
Лишилось дочекатись коли сьогоднішні моделі рівня 405b зможуть запускатись на побутових комп’ютерах 🤔
Тут я з Вами повністю згідний, нас чекає трансформація пошукових систем, дуже скоро ми будемо дивитись на теперішні текстові пошуки у Google чи Bing як на WEB 1.0.
Copilot про який Ви раніше згадували, вже демонструє це, тільки що протестував — голосовий режим працює чудово, вони вже прокачали синтез української мови, майже не відчувається «машинний» тон голосу.
Дякую за посилання.
Так, треба щось прикрутити по цьому напрямі.
Моя оцінка наступна, можливості великих мовних моделей будуть лиш зростати, я про мультимодальність.
Окрім роботи з текстом та зображеннями з’явиться синтез та розпізнавання мовлення, поєднуючи всі ці продукти(котрі зараз в основному працюють поки поодинці) у одну справді велику мовну модель. Текстовий режим, як показує практика доволі повільний якщо говорити про обмін токенами, я про це говорив у моїй статті:
dou.ua/forums/topic/49408
Буде оптимізація існуючих моделей, подвищення продуктивності(наприклад свіженька LLM DeepSeek V2 має у двійчі більшу швидкість генерації токенів), якщо порівнювати з іншими схожими по кількості параметрів LLM.
Дуже велику роль зіграють саме мобільні пристрої, бо ШІ і тема конфіденційності дуже важлива, тому моделі поступово переповзуть з хмар у наші пристрої, де будуть жити і розширювати наші можливості.
Останнє, це звісно мій прогноз на найближчі років
До речі про розпізнавання мовлення...
Я в статті доторкнувся теми обмежень по тривалості аудіо, але не розповів як вона вирішується в ідеалі:
huggingface.co/blog/asr-chunking
Аудіо ріжеться не просто шматками по 40 секунд, як роблю це я, а нарізається зі зміщенням, як описано у статті вище. Потім по словах, які повторюються відбувається склеювання тексту в єдине ціле.
Я цього механізму поки що не реалізував, бо не хотів ускладнювати цю версію коду(у всякому разі перед публікацією), проте це вже є інтегровано у локальному розпізнаванні мовлення, а саме pipeline Wisper(chunk_length_s=30s):
huggingface.co/openai/whisper-large-v3
Трохи є...
Дякую за ідею. Цікаво, скільки обчислювальних ресурсів для цього потрібно якщо говорити про еквівалент побутового комп’ютера?
Хороша думка підключити Wiki до свого чат-боту, це йому добавить трохи мізків.
Я запускав ще Base модель на відеокарті, то розпізнавання десь
Так, але він має обмеження в приблизно 45 секунд на один аудіо семпл(у всякому разі, я тестував на модельці розміром Medium).
github.com/...adme-ov-file#python-usage
Дякую за roadmap.
Дякую за коментар Богдан.
Мені до речі ще дуже бракує локальних ШІ, який б мав доступ до інтернету, щоб воно могло «читати» посилання, давати коротке резюме або взагалі — шукати в інтернеті потрібну інформацію.
LLM — найнижчий поріг входу в тематику ШІ, ось і все.
А що порекомендуєте далі вивчати, щоб це мало практичне застосування в повсякденному житті?
На базі цих напрацювань я приступив до даступного мого проєкту — голосовий помічник з ШІ, ось тут можна ознайомитись з його кодом(поки що досить сирий, але працює) або навіть запустити у консольному режимі:
github.com/...eAssistant/tree/main/code
Тут я вже відійшов від LLM Studio і зробив все використовуючи llama_cpp(на базі якої і побудована LLM Studio).
Ось і мій чат-бот з ШІ
dou.ua/forums/topic/49408
Можливо Вам пригодиться.
Кожна модель моє своє призначення, 8b/70b призначені для запуску на побутових комп’ютерах.