17 вересня Anthropic оприлюднила внутрішню оцінку: станом на серпень Claude веде 26% робіт із дослідження й розробки ШІ під наглядом людей. Частка на рівні співпраці або вище перевищує 90%; повної автономності немає в жодній виміряній підкатегорії. Індекс зважує роботи за приблизними трудовитратами; самі оцінки формує також Claude.
Новина порушує цікаве питання: як змінюється розробка моделей, коли інструмент стає учасником дослідницької роботи? Для читача важливо розрізняти обсяг делегованої роботи, право ухвалювати рішення та відповідальність за результат.
Чому один відсоток не описує всю роботу дослідника
У підході Epoch AI, на який посилається Anthropic, дослідження розкладають на конкретні завдання. Автори пропонують понад 60 завдань у шести категоріях і шкалу автоматизації від 0 до 5. Їхній аргумент: успіх на окремому тесті не охоплює складності реальної роботи — наприклад, координації кількох проєктів із нечіткими критеріями успіху. Таку класифікацію пропонують доповнювати вимірюваннями, а не вважати готовим прогнозом.
Звідси практичне запитання до будь-якої заяви про автоматизацію: що саме входить у вимірюваний процес? Написати фрагмент коду, обрати дослідницьку гіпотезу й вирішити, чи достатньо доказів для випуску продукту, — різні види рішень. Один загальний показник не пояснює, як розподілена відповідальність між ними.

Чи означає це, що ШІ вже створює себе сам
У своєму поясненні рекурсивного самовдосконалення Anthropic описує сильніший сценарій: модель повністю автономно розробляє наступника. Компанія прямо зазначає, що цього ще не досягнуто й такий розвиток не є неминучим. Вона також відокремлює виконання добре визначеного експерименту від дослідницького судження — вибору напряму та розуміння, який результат справді важливий.
Тому переносити показник участі інструмента на частку «замінених людей» некоректно: це інше питання, для якого потрібні інші дані. Так само з одного зрізу неможливо вивести дату появи системи, здатної самостійно керувати всім циклом розробки.
Хто перевірятиме таку роботу
Наступного дня Anthropic повідомила про партнерство з Accenture щодо оцінювачів, які працюватимуть усередині процесу розробки. Роботу Accenture фінансуватиме сама Anthropic. Компанія визнає, що правила доступу, звітності та фінансування ще потрібно визначити. Отже, оголошення партнерства не є завершеним незалежним аудитом наведених цифр.
Як читати наступні заяви про «ШІ, що створює ШІ»
- Шукайте опис завдання: що саме доручили системі й що залишилося людині.
- Розрізняйте самостійне виконання та самостійне визначення мети.
- Перевіряйте, хто вимірював результат і які дані може побачити зовнішній оцінювач.
- Звертайте увагу на помилки й час перевірки, а не лише на кількість виконаних дій.
Якщо ви обираєте помічника для власної роботи, почніть із конкретного сценарію. Наш розбір ChatGPT, Gemini та Claude допоможе сформулювати критерії порівняння; внутрішні показники лабораторії самі по собі не визначають, який сервіс зручніший саме вам.

Долучайтеся до розмови
Пишіть по суті й поважайте інших читачів. Перший коментар може з’явитися після перевірки редакцією.