Андрей Карпати представив LLM Council — інструмент для дебатів між мовними моделями
Відомий ентузіаст штучного інтелекту, співзасновник OpenAI та автор терміну «вайбкодинг» Андрей Карпати опублікував у відкритий доступ LLM Council — локальний вебдодаток, у якому кілька мовних моделей одночасно відповідають на одне запитання, оцінюють відповіді конкурентів і формують найоптимальнішу підсумкову відповідь.

Як працює рада мовних моделей
Ідея дуже проста. Користувач ставить одне запитання, а далі відбувається невеликий мультимодельний диспут. Спочатку кожна LLM генерує власну відповідь, а потім моделі отримують відповіді інших, але без інформації про те, хто їх написав. Після цього кожна модель починає критикувати та ранжувати конкурентів. І в кінці головна LLM узагальнює все й формує фінальну відповідь.
У стандартній конфігурації до дебатів входять GPT-5.1, Gemini 3 Pro Preview, Claude Sonnet 4.5 та Grok-4, але список можна змінювати через OpenRouter.
Моделі вважають GPT-5.1 найкращим
Карпаті тестував інструмент на завданнях, де важлива саме глибина мислення, наприклад, на аналізі книг. І тут моделі продемонстрували доволі цікаву поведінку.
У сліпому режимі, де вони не знають, де чия відповідь, GPT-5.1 стабільно отримувала найвищі оцінки. А ось Claude був у аутсайдерах.
Сам Карпаті каже, що не завжди повністю погоджується з цими оцінками. Його людське враження таке:
- GPT-5.1 інколи занадто балакучий;
- Gemini 3.0 — стриманіший і часто більш чіткий;
- Claude — максимально лаконічний, інколи навіть занадто.
Іншими словами, моделі оцінюють одна одну через власну призму, і ця призма може відрізнятися від людської. Це й робить експеримент цікавим.
Після публікації проєкту керівник Varick AI Agents написав, що створював свою внутрішню систему оцінювання, і результати були аналогічні. Більше того, коли моделі знали, що відповідь належить GPT, вони одразу починали виправляти себе.
Тобто на поведінку ШІ впливає й бренд моделі, навіть якщо він існує лише всередині системи.
Що всередині проєкту
Карпаті не робив із LLM Council складний продукт, швидше демонстраційний прототип. На бекенді використано FastAPI з async httpx, на фронтенді — React разом із Vite. Рендеринг відповідей реалізовано через react-markdown, а всі розмови зберігаються у вигляді JSON-файлів у директорії data/conversations/. Взаємодія з мовними моделями відбувається через OpenRouter API.
Щоб запустити проєкт локально, достатньо додати власний OPENROUTER_API_KEY. Детальна інструкція є в README репозиторію.

13 коментарів
Додати коментар Підписатись на коментаріВідписатись від коментарівКоли моделі знають, що відповідь належить GPT, вони починають коригувати свою поведінку.
Це означає що :
довіра моделей одна до одної може бути упередженою;
бренд впливає сильніше, ніж якість контенту;
при відкритій ідентичності моделей система працює нечесно і неправильно.
Фінальну відповідь формує «головна» модель, і вона може:
неправильно інтерпретувати критику інших;
спростити або спотворити зміст;
вибрати не найкращий, а «більш схожий на її стиль» варіант.
При великій кількості дебатів директорія data/conversations/ стане важко керованою.
Є пошук, індексації, видалення або архівації?Навіть якщо моделі ранжують одна одну, це не:
перевірка фактів;
не експертний консенсус;
не крос-перевірка з реальністю.
Це лише стилістичний вибір, а не верифікація.Моделі не мають цілі «перемогти» чи "виграти аргумент".Вони просто генерують текст у рамках промпта. Тому якість дебатів може бути поверхневою.
А де теорема про безкоштовні обіди???
я так робив кілька разів (одне питання задавав кільком моделям... щоправда послідовно)
в основному причина була економічна — зараз моя улюблена модель Claude не працює... ліміти...
тому юзаю Gemini
(а з ChatGPT я посварився... він мене чомусь найбільше бісить...)
...................
Сьогодні з’ясовував дуже серйозне питання — як боротися із совкою на томатах, так щоб не кропити...
(гусінь може погризти половину врожаю... це капець які збитки...)
Так от... спочатку з Клодом з’ясували, що більше за томати совка любить кукурудзу і нут з горохом..
Ще раз... коли поруч з томатами починає цвісти кукурудза, ці метелики усе кидають, і мерщій летять туди...
Це дуже важливе відкриття... але я про всяк випадок спитав Клода — а наскільки це обгрунтовано? які твої джерела?
Трохи подумавши — він сказав:
ой!
Вибач, я помилився... насправді топ-меню для совки — це нут... а на кукурудзі совки пасуться нарівні з томатами...
і видав посилання на джерело — оксфордську статтю ...
Словом, ситуація залишалася досить плутаною...
Тут якраз Клод вимкнувся до 21.00, і я перейшов на Gemini.
Спочатку задав основне питання:
— Совка, яка гризе томати, які рослини любить більше за томати?
(ясна річ, коли інша модель видасть аналогічну відповідь — значить... це правда... мабуть)
І Gemini сказало:
1) Кукурудза... 2) Бобові (нут, квасоля, горох і т.д)
Супер! Значить я копаю у вірному напрямку!
Далі я задав хитре питання:
— А от інша велика модель ллм стверджує, що совка летить в першу чергу на нут, а на кукурудзу — нарівні з томатами...
І тут професор Gemini впевнено заявив:
— Треба розбиратися... все залежить від... не все так однозначно..
.........
.........
Кароче...по-перше, совок, які жеруть томати, є 2 види...
1) Томатна совка (карадрина).
Ознака: вона спочатку обгризає листя ... воно стає прозорим, як марля.. і вони нападають бандами...
2) Бавовняна совка.
Ознака: вона листя взагалі не чіпає... а в одиночку, акуратно, прогризає дірочку в помідорі біля плодоніжки, і там собі живе...
За всіма ознаками в мене на городі була бавовняна совка... бо листя все ціле, а плоди пошкоджені...
Gemini авторитетно заявив:
У твоєму випадку (шкідник — бавовняна совка) кукурудза — саме те, що треба... висадити по периметру ділянки...
(А от якби був другий вид — томатна совка... вона одразу летить на томати... і ніяка холєра її не вхопить... ну хіба що нут поруч посадити...тут Клод був правий... просто тут урок... треба бути уважним... і точніше ідентифікувати проблему... бо вилазять нюанси...)
...........
далі Gemini тицьнув пальцем на таку проблему:
Так, метелики совки летять в першу чергу на кукурудзу...
Але... тільки поки вона цвіте!
Питаю: може є ремонтантні сорти, як у суниці... щоб качани були все літо? нє... нема таких...
Дійшли до висновку, що треба зробити конвейєр — сіяти ранню кукурудзу кожні два тижні... щоб постійно була...
Качани з гусінню знищувати... спалювати...2-3 дні під водою уся совка загине...
Питаю, нащо качани спалювати — коза з’їсть.
Він: чудова ідея!
Я: а ще можна водою залити, а потім закомпостувати...
Він: точно, за
.................
Одним словом... цікаво... і корисно... дуже високий рівень дискусії...
З людьми так не вийде...
по-перше, хороший експерт — це дорого..
по-друге, моделі можна задавати дурні запитання, і вона терпляче роз’яснює... розкладає по-поличкам...
І ти розумієш, що ніхто не сміється з твоїх дурних запитань... розслабляєшся... і в цьому стані все більше спливає інсайтів... запитання стають все розумнішими... і результати кориснішими... магія........
.............
А якщо кілька моделей посадити за один стіл? 🤔
Все одно є економічні обмеження... чим розумніша модель, чи налаштування «thinking»... тим дорожче час...
Тому... модеруючи дискусію... мабуть варто працювати не в стилі — а ти хто такий? яка модель краща...
А усім разом працювати над цікавою задачею... проблемою... в процесі з’являються нові питання ... нові горизонти...
............
Ще один прикол пригадався ...
Намагаюся вивчати дослідження операцій (operations researh)... один з напрямків математики...
На просторах інтернету відкопав найсучасніші англомовні підручники...
Думаю, згодую їх потрохи Клоду... ще плюс старі підручники... видалимо зайве ... систематизуємо ... буде мій особистий супер-підручник... у html або пітоні... завжди хотілося заховати приклади під спойлер...
Так от... щось у нього спитав (щоправда в розширеному режимі) ... він поліз в інтернет... думав 32 хвилини (!)... вивчив інформацію з 567 сайтів... у якості джерел згадав ті самі нові підручники... плюс програми з МТІ, Стенфорду, Берклі... капець... оце викладач дома з’явився... за 20 баксів у місяць... я тіряюсь... треба мерщій засипати його розумними питаннями... поки інтернет не закінчився 🤔
res.cloudinary.com/.../xwuifh6xpftlsp6thbil.jpg
res.cloudinary.com/.../at9ab6y9yanmrsm2m2pa.jpg
Саме про це давно хотів сказати. З людьми я спілкуюся зовсім жахливо. З ШІ напроти — абсолютно прегарно. Але чого так? Думаю — через квантово механічну природу спілкування.
Два різновиди совки...
он воно що 🤔
Людина vs людина це зовсім не те, що людина vs ШІ. Обмін інформаційний відбувається зовсім іншим чином. ШІ слухняно генерує з наданого тобою контекста більш повну версію.
Ахахахахаха+*-*-*-* А що вони тепер скажуть про корисність дл економіки використанніа обладнанн з балансовою вартістю, що дорівнює 0? Дл виробництва, а точніше — перевиробництва бо це буде перевиробництво, тобто виробництво, з заниженою собівартістю і не змінною чомусь ціною?
вони подумають:
*дядьку, сформулюйте по-нормальному*
а скажуть... зададуть купу уточнюючих питань... і одразу згенерують купу ідей... потрібних і не потрібних...
і шо ти будеш з цим далі робити ? 🤔
От уяви — у процессі написання клавіатура відмовила
а якщо вони об’єднаються проти тебе? 🙂
👍👍👍👍👍