Як OpenAI використовував кенійців, щоб зробити ChatGPT менш токсичним. Розслідування Time

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Після випуску в листопаді минулого року ChatGPT назвали однією з найвражаючих технологічних інновацій 2022 року. Потужний чат-бот зі штучним інтелектом (ШІ) може генерувати текст практично на будь-яку тему, від шекспірівського сонета, до складних математичних теорем, описаних мовою, зрозумілою п’ятирічній дитині. Вже за тиждень після релізу ChatGPT мав понад мільйона користувачів.

Але ця історія успіху не лише про геніїв з Silicon Valley. У своєму прагненні зробити ChatGPT менш токсичною, OpenAI використовував аутсорсингових кенійських робітників, які заробляли менш як 2 долари на годину.

Видання TIME провело розслідування щодо цього, а ми переказуємо найцікавіші тези з нього.

Попередниця ChatGPT, GPT-3, також продемонструвала вражаючі результати з генерування тексту. Але комерційно вона була невдалою, оскільки була схильна до насильницьких, сексистських і расистських зауважень. Це тому, що GPT-3 була навчена на сотнях мільярдів слів, взятих з Інтернету — величезного сховища людської мови.

Щоб розв’язати цю проблему, потрібно було навчити AI розпізнавати приклади насильства, hate speech та сексуального насильства. Щоб зібрати приклади такого контенту, в листопаді 2021-го OpenAI надіслав десятки тисяч фрагментів тексту до аутсорсингової компанії в Кенії для розпізнавання та маркування.

Деякі з них детально описували ситуації, такі як сексуальне насильство над дітьми, зоофілія, вбивство, самогубство, тортури, самоушкодження та інцест.

Аутсорсинговим партнером OpenAI була компанія Sama, яка наймає працівників у Кенії, Уганді та Індії для маркування даних для клієнтів Кремнієвої долини, таких як Google, Meta та Microsoft.

«Класифікація та фільтрація шкідливого контенту є необхідним кроком для мінімізації кількості насильницького та сексуального контенту, включеного в навчальні дані, і створення інструментів, які можуть виявляти шкідливий контент», — заявив прессекретар OpenAI розслідувачам.

Документи, які перевірив TIME, показують, що наприкінці 2021 року OpenAI підписала з Sama три контракти на загальну суму близько 200 000 доларів США для позначення текстових описів сексуального насильства, ненависті та насильства. Близько трьох десятків працівників розділили на три команди, по одній зосередившись на кожній темі. Троє співробітників повідомили TIME, що вони повинні були прочитати та позначити від 150 до 250 уривків тексту за дев’ятигодинну зміну. Ці фрагменти можуть варіюватися від 100 слів до понад 1000. Усі четверо співробітників, опитаних TIME, сказали, що робота їх психічно вразила. Попри те, що вони мали право відвідувати сеанси з психотерапевтами, усі четверо сказали, що ці сеанси були марними та рідкісними через високі вимоги бути більш продуктивними на роботі. Двоє сказали, що їм надали лише можливість відвідувати групові сеанси, а один сказав, що їхні прохання відвідати консультантів на індивідуальній основі замість цього неодноразово відхилялися керівництвом Sama.

У лютому 2022 року стосунки між Sama та OpenAI зіпсувались. Того місяця Sama розпочала пілотну роботу над окремим проєктом для OpenAI: збором сексуальних і насильницьких зображень (деякі з них заборонені законодавством США) для OpenAI. Робота з маркування зображень не пов’язана з ChatGPT, але OpenAI також створює технологію генерації зображень.

У своїй заяві представник OpenAI не вказав призначення зображень, які компанія замовила у Sama, але сказав, що маркування шкідливих зображень було «необхідним кроком» для того, щоб зробити її інструменти AI безпечнішими.

У лютому, згідно з одним платіжним документом, розглянутим TIME, Sama поставили OpenAI зразкову партію з 1400 зображень. Згідно з документом, деякі з цих зображень були віднесені до категорії «C4» — внутрішня мітка OpenAI, яка позначає сексуальне насильство над дітьми. У добірку також включені зображення «C3» (зоофілія, зґвалтування та сексуальне рабство) і зображення «V3», які відображають графічні деталі смерті, насильства чи серйозних тілесних ушкоджень, згідно з платіжним документом.

Згідно з документом, OpenAI заплатив Сама 787,50 доларів США за збір зображень. Але за кілька тижнів Sama зупинила всю свою роботу для OpenAI — на вісім місяців раніше, ніж було обумовлено в контрактах.

У заяві аутсорсингової компанії зазначено, що її угода про збір зображень для OpenAI не містить жодних посилань на незаконний контент, і лише після початку роботи OpenAI надіслали «додаткові інструкції» щодо «деяких незаконних категорій».

👍ПодобаєтьсяСподобалось2
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Підписатись на коментарі