«Тепер не рандомайзер токенів»: дослідники знайшли в надрах Claude прихований простір, де ШІ потайки обмірковує відповіді

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Компанія Anthropic опублікувала результати свого величезного свіжого дослідження, відповідно до якого всередині мовних моделей серії Claude виявили структуру, яка функціонально нагадує «глобальний робочий простір» із нейробіології людської свідомості.

А тепер давайте простими словами. Виявилося, що нейронки не механічно вгадують наступне слово, а мають своєрідну приховану «короткочасну пам’ять» або внутрішній простір для роздумів. І за сутністю це схоже на те, що мають люди.

П’ять ключових властивостей «робочого простору» ШІ

Деталі

Згідно з дослідженням, величезна частина обчислень нейромережі відбувається автоматично і залишається недоступною. Проте за допомогою нового спеціального інструменту «лінза Якобі» (або ж J-lens) вчені знайшли особливу групу внутрішніх репрезентацій — J-Space.

Це привілейована зона, де ШІ утримує ідеї та проміжні міркування, які він обмірковує, але не обов’язково виводить у фінальний текст. Розробники зазначають, що цей простір не був запрограмований штучно, а виник самовільно як корисна для обчислень архітектура.

Дослідники пояснюють, що J-простір працює як своєрідна оперативна пам’ять або «центр трансляції». Він має суворо обмежену місткість (одночасно вміщує лише близько 25 концептів) і відповідає за менш ніж 10% загальної дисперсії активацій моделі, але його вектори значно сильніше підсилюються іншими шарами мережі.

Наприклад, коли моделі ставлять логічне запитання про кількість ніг у тварини, що плете павутиння, система спочатку генерує у своєму робочому просторі проміжний концепт «павук», утримує його в пам’яті і лише після цього видає користувачу цифру «8».

Приклад з павуком

Причому дослідники спробували перехитрити цей процес і використали техніку swapping. Вони взяли і примусово замінили у J-просторі координату концепту «павук» на «мураха» безпосередньо під час обчислень. Результат? Модель замість «8» слухняно видала цифру «6». Завдяки цьому вони змогли довести, що цей простір безпосередньо керує логікою ШІ, а не просто відображає якісь побічні процеси.

Також, як виплило з дослідження, цей J-простір виявився мультимовним і абстрактним. Якщо модель читає текст іспанською чи китайською і має відповісти цими ж мовами, у своїх прихованих роздумах вона все одно оперує універсальними семантичними концептами, повністю незалежними від конкретної мови.

Як зазначили представники компанії, ця структура функціонує переважно у середніх шарах нейронок, тоді як перші шари відповідають за синтаксис, а останні — за безпосередню генерацію наступного слова.

Як саме розподіляються обов’язки всередині моделі

Нове відкриття розглядається фахівцями як доказ того, що моделі здатні до складних багатоетапних міркувань, які імітують людські когнітивні процеси. Наприклад, у ШІ спостерігається психологічний «ефект білого ведмедя»: якщо дати моделі пряму вказівку не думати про певну річ, ця заборонена думка все одно проривається у робочий простір. Постарайтеся зараз не думати про слона. Вийшло? :)

Візуалізація ефекту «Білого ведмедя»

Найцікавішим стало те, що донавчена мережа здатна помічати власні провали в увазі. Поруч із забороненою думкою лінза фіксувала появу слів на кшталт «damn» або «failed» :)

З повним дослідженням можете ознайомитися тут.

Загалом виглядає досить цікаво, як на мою думку. Можливо, в найближчому майбутньому модельки перестануть бути звичайними рандомайзерами токенів? Що думаєте про це та про дослідження?

👍ПодобаєтьсяСподобалось3
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Придумав собі круту роботу: Спілкування з LLM моделями.

Перечитав оригінальну роботу.
Не знайшов тих тверджень, що у статті.

Дослідники знайшли спосіб читати частину внутрішніх репрезентацій Claude через Jacobian lens / J-lens і показали, що певні «вербалізовані» напрями в активаціях можуть брати участь у проміжних обчисленнях.

Як із цього автор зробив висновок, що нейронки не механічно вгадують наступне слово?

Дослідження аналізує, як внутрішні активації впливають на майбутні вихідні токени.
Як із цього автор зробив висновок, що

виявилось, вони не передбачають токени

?

довели, що цей простір безпосередньо керує логікою ШІ

І такого в досліджені немає.

Дослідження про те, що інженери знайшли методу, щоб можно було аналізувати деякі властивості їх моделі, а не дивитися на модель як на повний black-box.

От одразу відчувалося, що десь тут вчений згвалтував журналіста :))

Підписатись на коментарі