LLM, VLM чи Computer Vision: як обрати правильну модель для візуальної задачі

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Привіт, спільното!

Мене звати Марта, і я вже понад два роки займаюся Data Science та AI/ML. Цього року я закінчила прикладні науки в Українському католицькому університеті, а зараз працюю Middle AI/ML Engineer у Sombra. Мій основний фокус — Computer Vision, Agentic AI та практичне застосування ML у продуктах.

У цьому матеріалі я хочу зробити короткий вступ до Computer Vision. Пояснити, що це таке, які задачі він розв’язує, чим класичні CV-моделі відрізняються від LLM/VLM. Як зрозуміти, коли варто використовувати спеціалізовану модель комп’ютерного зору, а коли достатньо великої мультимодальної моделі на кшталт GPT-4o, Gemini чи Claude.

Саме тут з’являється Computer Vision — напрям штучного інтелекту, який дає комп’ютерам змогу обробляти, аналізувати й інтерпретувати зображення та відео. CV допомагає машині «бачити» не в людському сенсі, а в інженерному: знаходити об’єкти, класифікувати зображення, визначати координати елементів, виділяти області, відстежувати рух і перетворювати картинку на структуровані дані.

Understanding Computer Vision - Zilliz Learn

Людина бачить собаку на фото майже миттєво (ліворуч). Комп’ютер бачить матрицю пікселів — чисел, які описують кольори та їх яскравість (праворуч). Завдання Computer Vision — навчити модель знаходити у цих числах зміст.

Are Corgis Good Farm Dogs? 5 Things to Know - Hobby Farms

Які задачі виконує Computer Vision

1. Класифікація

Класифікація відповідає на питання: «Що зображено на картинці?»

Наприклад, модель отримує фото і має визначити, що на ньому: кіт, собака, автомобіль, чек, медичний знімок певного типу тощо.

Це один із найпростіших сценаріїв: модель не обов’язково знає, де саме на зображенні розташований об’єкт. Вона просто повертає клас.

2. Object Detection

Object Detection відповідає вже на два питання: «Що є на зображенні?» і «Де саме це розташовано?»

Наприклад, на фото дороги модель може знайти автомобілі, пішоходів, дорожні знаки й повернути bounding boxes — координати прямокутників навколо кожного об’єкта.

Це важливо там, де потрібна не просто відповідь «тут є машина», а конкретне розташування об’єкта.

3. Segmentation

Segmentation іде ще глибше: вона визначає не просто прямокутник навколо об’єкта, а точну область пікселів, яка до нього належить.

Наприклад, якщо задача — оцінити пошкодження авто, то авто segmentation-модель може виділити саме пошкоджену частину кузова. У медичних зображеннях вона може допомагати виділяти певні тканини, органи або потенційно проблемні ділянки.

4. Tracking та інші задачі

Tracking використовується, коли потрібно відстежувати об’єкти в часі: автомобілі на дорозі, людей у відеопотоці, рух роботизованої руки тощо.

Окрім цього, є OCR, pose estimation, depth estimation, anomaly detection, image retrieval та багато інших напрямів.

Навіщо Computer Vision, якщо є Vision-Language Models як GPT-4o?

Сьогодні, коли є GPT-4o, Gemini, Claude та інші Vision-Language Models, виникає логічне питання: якщо модель уже може «дивитися» на зображення і відповідати на питання, навіщо нам спеціалізовані Computer Vision-моделі?

Коротка відповідь: тому що це різні інструменти для різних задач.

LLM (Large Language Model) — це модель, яка працює з текстом і міркує мовою. LLM працює з текстовими токенами. Її типовий input — prompt, документ, інструкція або діалог. Output — згенерований текст: відповідь, summary, класифікація, витягнуті сутності або reasoning на основі текстового контексту.

VLM (Vision Language Model) — це модель, яка може працювати і з текстом, і з зображеннями: описувати картинки, відповідати на питання про них, робити узагальнення. VLM працює з комбінацією зображення і текстового prompt. Її типовий input — image + question. Output — текстова відповідь: опис сцени, відповідь на питання, загальний висновок або пояснення того, що відбувається на зображенні.

CV-модель це зазвичай спеціалізована модель, навчена дуже добре виконувати одну конкретну візуальну задачу: знайти об’єкти, повернути координати, виділити маску, класифікувати зображення або працювати в реальному часі. CV-модель працює напряму з візуальними даними: зображенням або відео як tensor-представленням. Її output зазвичай структурований: class label, confidence score, bounding boxes, segmentation masks, keypoints, embeddings або tracking IDs.

VLM може дуже добре пояснити, що відбувається на зображенні. Але якщо вам потрібні точні координати кожного елемента, стабільна робота на тисячах однотипних зображень, низька затримка, on-device inference і контрольована вартість — класична CV-модель часто буде кращим вибором.

Уявімо медичний ultrasound-знімок.

VLM може описати його людською мовою: сказати, що це, ймовірно, ультразвукове зображення певної області, описати видимі структури, дати загальний коментар.

Але якщо задача полягає в тому, щоб стабільно знаходити конкретну область, вимірювати її, порівнювати розміри, повертати координати або маску — потрібна спеціалізована CV-модель, навчена саме на таких даних.

Те саме стосується багатьох доменів: медицини, страхування, autonomous driving, retail analytics, robotics, manufacturing quality control.

Якщо показати VLM фото пошкодженого автомобіля, вона може описати, що бачить: наприклад, що пошкоджена передня частина авто, бампер, крило або фара.

Це корисно для загального аналізу.

Але якщо бізнес-задача — автоматично оцінити площу пошкодження, виділити конкретну пошкоджену область, порівняти її з іншими частинами авто або передати структурований результат у систему оцінки збитків, то краще підходить segmentation-модель.

Тут важлива не красива текстова відповідь, а точна, повторювана і машинно-читабельна структура.

Інші use cases Computer Vision

Computer Vision широко використовується у дуже різних сферах.

У військових задачах — для аналізу зображень із дронів, виявлення техніки або об’єктів на місцевості.

В autonomous driving — для розпізнавання смуг, автомобілів, пішоходів, знаків і прогнозування ситуації на дорозі.

У traffic analysis — для підрахунку автомобілів, аналізу заторів, виявлення порушень або оптимізації міської інфраструктури.

У robotics — для того, щоб робот міг бачити об’єкти, брати їх, сортувати або взаємодіяти з фізичним середовищем.

У медицині — для аналізу рентгенівських знімків, МРТ, УЗД, гістологічних зображень.

У виробництві — для контролю якості, пошуку дефектів, перевірки пакування або сортування товарів.

Спільна риса хороших CV-use cases: це повторювані задачі з великим обсягом візуальних даних, де важлива стабільність, швидкість і ціна помилки.

Як обрати модель для своєї задачі

Якщо ви хочете застосувати Computer Vision у продукті, не обов’язково одразу тренувати модель з нуля.

Я б мислила про це так.

Спочатку варто пошукати вже наявні моделі для схожих задач. Часто можна знайти open-source модель або pretrained checkpoint, який уже не погано працює у вашому домені.

Якщо готова модель працює недостатньо добре, наступний крок — fine-tuning на власних даних. Це часто найпрактичніший варіант: ви використовуєте вже навчену модель, але адаптуєте її під свої зображення, класи, стиль інтерфейсу або домен.

Тренувати модель з нуля варто тоді, коли задача дуже специфічна, даних багато, а готові рішення не підходять. Це дорожче, складніше і потребує більше експериментів.

Задача

Що потрібно отримати

Який підхід може підійти

Класифікація зображень

Визначити один або кілька класів для всього зображення

Pretrained classifier, fine-tuning ResNet/EfficientNet/ViT

Object detection

Знайти об’єкти та їхні координати

YOLO, Faster R-CNN, DETR або інші detection-моделі

Segmentation

Виділити точну область об’єкта на зображенні

U-Net, Mask R-CNN, SAM-based підходи, segmentation-моделі

Візуальне питання-відповідь

Отримати текстову відповідь або пояснення по зображенню

VLM: GPT-4o, Gemini, Claude, LLaVA-подібні моделі

Real-time / on-device inference

Швидка робота без cloud API

Легкі CV-моделі, quantization, Core ML / TensorRT / ONNX Runtime

І найважливіше: не забувайте про evaluation.

Чому accuracy 95% може бути поганим результатом

У Computer Vision дуже легко сказати: «У нас accuracy 95%, отже все добре».

Але це не завжди так. Ба більше, для багатьох CV-задач accuracy взагалі не є головною метрикою. Наприклад, у detection і segmentation нас часто цікавить не лише те, чи модель «впізнала» об’єкт, а й наскільки точно вона його локалізувала.

Для object detection важливими можуть бути precision, recall, F1-score, mAP, latency і стабільність на edge cases. Для segmentation особливо важливий IoU — метрика, яка показує, наскільки predicted mask збігається з реальною областю на зображенні. Тобто модель може правильно визначити, що на фото є автомобіль або дефект, але якщо вона неточно виділяє його межі, для бізнес-задачі це все одно може бути поганим результатом.

По-перше, якщо дані незбалансовані, accuracy може обманювати. Наприклад, якщо 95% зображень не містять дефекту, модель може завжди казати «дефекту немає» і формально мати 95% accuracy, хоча насправді вона не розв’язує задачу.

По-друге, різні типи помилок мають різну ціну.

У задачі cancer detection пропустити пухлину — тобто отримати false negative — набагато гірше, ніж зайвий раз відправити зображення на перевірку лікарю.

А у spam filter, навпаки, false positive може бути болючішим: якщо система помилково заблокує важливий робочий email, це може створити серйозні проблеми.

Тому правильний threshold, метрика й evaluation strategy залежать не лише від моделі, а й від бізнес-контексту: що саме коштує дорожче — пропустити проблему чи помилково її знайти.

Висновки

Computer Vision, LLMs і VLMs — це не конкуренти, а різні інструменти.

VLM чудово підходить, коли потрібно описати зображення, відповісти на питання або зробити reasoning на основі візуальної інформації.

Computer Vision краще підходить, коли потрібні точні координати, стабільність, швидкість, on-device inference, низька вартість на великому обсязі даних і контрольований output.

Якщо коротко, хороший CV-use case зазвичай виглядає так: є багато візуальних даних, задача повторюється, людям складно або дорого виконувати її вручну, а помилки мають відчутну ціну.

Тому головне питання, яке варто поставити собі в роботі:

Яку візуальну задачу ми виконуємо часто, де важлива стабільність і де помилки дорого коштують?

Саме там може ховатися ваша найкраща можливість для Computer Vision.

👍ПодобаєтьсяСподобалось18
До обраногоВ обраному11
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Стаття цікава. Але є нюанс з термінологією — ми часто плутаємо окремі моделі проти складні системи (як у випадку з VLM, де це конвеєр з кількох компонентів). Можливо, варто розділяти ці поняття, щоб краще розуміти, що насправді працює «під капотом», модель чи система?

Класна стаття! Очікуємо на продовження подібного або деталізації!

А ось @Dmytro Voitekh з вами не згоден. Бо у своїй статті описує (dou.ua/forums/topic/59990), що можливо детектувати зони на зображенні. При цьому, цих зон більше десятка.
P.S> Я скільки не пробував, звагілі ніяк. Хоч few-shot з прикладами, будь шо. Тільки класичний YOLO нормально детектує. Чогось ми не знаємо, або хтось лукавить ))

Прикольна стаття!
Можна було б ще додати інформацію про OCR для порівняння.
Бо часто хочуть витягувати інформацію зі скріншотів чи графіків чи документів.
Є спеціалізовані рішення, а можна дати VLM.

Підписатись на коментарі