War of Words — новий ШІ-інструмент для аналізу російської ТБ-пропаганди: як він працює та ідеї для покращення продукту
Щосекунди Росія генерує сотні одиниць пропаганди. Дезінформація передує усім війнам, які розпочинає країна-агресорка — в Україні, Сирії, Грузії — про це свідчить аналіз інформаційних кампаній проти кожної з цих держав. Такі ж засоби пропаганди Росія застосовує і проти деяких країн-членів ЄС і НАТО, які можуть стати наступними в цьому списку.
Вручну обробляти всі масиви відео та аудіо, які продукують російські пропагандистські джерела, довго і складно, особливо для іноземців, які перекладають їх перед аналізом. А в умовах, коли нові злочини продукуються щосекунди, потрібен швидкий та автоматизований інструмент.
З цією метою був створений проєкт War of Words — перший англомовний інструмент на основі штучного інтелекту, який дозволяє аналізувати 100+ тисяч годин контенту з ТБ, Telegram чи RuTube в декілька кліків.
Як працює інструмент
Ми архівували всі новинні та інформаційно-політичні телевізійні програми ключових каналів з 2012 року. Цей архів, який містить понад 100 тисяч годин відео та аудіо, зберігається у хмарному сховищі за межами України та росії. Навіть якщо росіяни видалять свої відео з усіх джерел, ми маємо цей контент із усіма метаданими.
Архів щоденно поповнюється та розшифровується. Розшифровка відео та аудіо у тексти російською мовою здійснюється за допомогою Microsoft Azure, а переклад на англійську — Chat GPT-4. Більшість великих мовних моделей (LLM) надають базові, цензуровані відповіді без емоційного контексту. War of Words використовує спеціально налаштовані LLM з комплексними промптами. Наприклад, якщо в ефірі використовується слово «піндоси», у перекладі буде примітка, що це зневажливе позначення американців пропагандистами. Це дозволяє передати не тільки зміст, але й емоційний контекст.
LLM моделі платформи також можуть класифікувати контент за наративами та меседжами, дозволяючи проводити статистичний аналіз, підраховуючи частоту згадувань певних наративів, включаючи непрямі висловлювання. Важливо відстежувати синхронність появи нових слів та меседжів, оскільки вони часто з’являються одночасно на різних платформах.
Ми також розробили сайт з відкритим доступом, де користувачі можуть здійснювати пошук за ключовими словами англійською та мовою оригіналу, фільтрувати результати за датою, типом медіа, джерелами, програмами, спікерами та іншими параметрами. Дашборди дозволяють відстежувати динаміку змін. Для дослідників є розширена версія з додатковими функціями, такими як завантаження корпусів розпізнаних текстів для детального аналізу.

Нижче — спрощена схема, як всі ключові технології працюють у зв’язці. Деякі технологічні деталі ми опускаємо з метою безпеки та запобігання атак на платформу.

Кейси пошуку інформації зі скріншотами
Кейс 1
Наприклад, ми хочемо дізнатись що говорив Путін за останній рік на телебаченні про нацистів. Стартовий екран виглядає так:

Формуємо запит:
- вводимо «нацист*» у поле пошуку, щоб отримати всі програми, де це слово використовувалось у різних граматичних формах та оборотах
- обираємо дату 1Y (один рік) та тип медіа TV

Нижче в полі вибору спікера вводимо прізвище Путіна російською мовою і вибираємо його.

Також можемо відсортувати видачу наприклад по даті ефіру, так щоб останні програми були нагорі:

Клікаємо на першу програму, справа відкривається вікно з текстом і відео (його можна розкрити на весь екран, для цього треба натиснути виділену червоним овалом іконку з двома стрілочками з правого меню):

Відео і текст одразу перемотані на місце, де слово із запиту зустрічається вперше, слово виділено жовтою підсвіткою. Користувач може натиснути на програвання відео і насолоджуватись промовою військового злочинця Володимира Путіна.
Кейс 2
Можливо ви побачили статтю із цікавим фрагментом і хочете знайти всю програму. Наприклад:

Бачимо, що матеріал вийшов 8 травня 2022, тож маємо обмеження по даті пошуку (скоріше за все програма вийшла кілька днів тому, але про всяк випадок поставимо широкий діапазон, який потім можна звужувати, якщо буде випадати надто багато випусків зі схожими текстами). Також знаємо ім’я спікера — Олексій Журавльов і знаємо, що сказано це було на каналі Росія 1.
Розставляємо фільтри:
- Запит — «*миллиона украинцев должны быть денацифицированы». Зірочка на початку дає можливість не втрачати дані в залежності від того як система розшифрувала числа — числом чи літерами.
- Дата 01.01.2012 — 08.05.2022
- Канал: Росія 1
- Спікер: Олексій Журавльов

Цього разу пощастило, одразу знаходимо потрібний матеріал:

Це програма «60 минут» від 5 травня 2022. Бігунок вже встановлено на потрібному місці на відео і в тексті.
Висновок: виклики та майбутні складові платформи
Інструмент War of Words стикається з рядом викликів. Наприклад, російські ТБ-канали періодично змінюють посилання на свої сайти, що вимагає додаткового часу на ідентифікацію нових URL та відновлення завантаження. Крім того, як і в будь-якій системі, існує невеликий відсоток неправильних розпізнавань голосів, оскільки спікери іноді кричать, шепочуть або говорять одночасно, що може збивати з пантелику ШІ, як і людей. Для максимізації точності ми вручну маркували близько 700 основних спікерів у системі.
Розвиток нових моделей та технологій також є викликом, оскільки платформу потрібно постійно оновлювати. Ми шукаємо фінансування для деяких технологічних покращень, зокрема інтеграції Chat GPT таким чином, щоб можна було використовувати менш чіткі запити та отримувати більш комплексні відповіді.
Крім цього ми плануємо створити більш глибоку систему фільтрації контенту за контекстом, щоб користувачі могли шукати за ключовими словами на кшталт «геноцид», «викрадення дітей», «стаття 119» тощо, отримуючи відповідні кейси у результатах пошуку. Таке збагачення даних було б дуже корисним для документування російських злочинів та зекономило б час державним органам у підготовці кримінальних справ. Також ми працюємо над додатковим маркуванням текстів на ознаки агресії та порушення українського й міжнародного законодавства.
А які ідеї/пропозиції для покращення продукту маєте ви?
Офіційний сайт проєкту: aboutwarofwords.info
Доступ до ресурсу: warofwords.info
Розробники: ГО «Змінюємось разом»
5 коментарів
Додати коментар Підписатись на коментаріВідписатись від коментарівЩе дуже хочеться розгорнутий коментар щодо власників ГО «Змінюємось разом» з Російської Федерації. (розробники цього проєкту)
opendatabot.ua/c/40630581
Віталію, вітаю! У складі засновників дійсно був громадянин РФ, який вже більше 15 років проживає на території Украіни. Він вийшов зі складу учасників 01.08.2019. Наразі у складі ГО громадян РФ немає.
1. Можливість відфільтрувати пряму мову (чи наявність серед спікерів) наступних категорій осіб сильно розширила б юз-кейси:
— Державні особи по різним категоріям (члени уряду, регіональні керівники, тощо)
— Військові
— Громадяни конкретних країн
2. Вільний доступ до даних по API
Дякую, що розповіли!
Нажаль, це дуже мало каже про доцільність та призначення такого інструменту.
Дуже хочеться знати, як практично ця інформація використовується, чи може використовуватись в державних інтересах.
Конкретні прикладні сценарії, актуальні та можливі.
Не дуже коректно в одному випадку вказувати мовну модель, а в іншому клауд провайдера. Та й хотілось би знати, що за модель взяли для транскрипції відео.