Водяний знак у текстах Claude: як він працює і чого не доводить

Anthropic додасть до майбутніх моделей Claude статистичний водяний знак без прихованих символів. Пояснюємо, як його перевірятимуть, де він слабшає і чому результат не доводить авторство.

Абстрактний текстовий потік під аналітичною лупою поруч із графіком імовірності водяного знака

Anthropic планує додати до текстів майбутніх моделей Claude статистичний водяний знак, який неможливо побачити під час читання, але можна перевірити за допомогою спеціального ключа. Це не набір прихованих символів, не підпис конкретного користувача і не безпомилковий доказ того, хто написав документ. Система лише допомагає оцінити ймовірність того, що Claude брав участь у створенні або суттєвому редагуванні тексту.

Зміна пов’язана з вимогами прозорості AI Act, які почали застосовуватися в ЄС 2 серпня 2026 року. Водночас вона відповідає на ширше практичне питання: чи можна надійно відрізнити текст ШІ від людського. Коротка відповідь — інколи можна знайти технічний сигнал водяного знака Claude, але один результат детектора не встановлює авторство, намір, правдивість матеріалу або порушення правил.

Що саме оголосила Anthropic

У поясненні від 14 серпня Anthropic повідомила, що майбутні моделі Claude генеруватимуть текст із водяним знаком. Це формулювання важливе: воно не означає, що кожна відповідь усіх доступних 18 серпня моделей уже гарантовано позначена. Для моделей, випущених до 2 серпня, передбачений перехідний період, а розгортання для них триватиме протягом наступних місяців.

На старті Anthropic збирається застосовувати маркування глобально, а не тільки для користувачів у ЄС. Компанія пояснює це тим, що поки не має надійного способу обмежити технологію регіоном. Перевіряти водяний знак згодом можна буде через окремий API, але станом на дату публікації статті Anthropic ще не відкрила його і не назвала точного терміну запуску.

Як водяний знак потрапляє в звичайний текст

Мовна модель складає відповідь послідовно, обираючи наступний токен — слово, частину слова або інший фрагмент. Часто є лише один доречний варіант: після «2 + 2 =» відповідь не можна довільно замінити іншим числом. Але в багатьох реченнях модель має кілька майже рівноцінних способів продовжити думку. Наприклад, погоду можна назвати «хмарною» або «похмурою», не змінюючи основний зміст.

Водяний знак використовує саме такі низькоризикові вибори. Ключ разом із кількома попередніми словами впливає на джерело випадковості, за яким модель обирає один із доречних варіантів. У довшому тексті формується статистична послідовність. Людина не бачить її, але детектор із відповідним ключем може порівняти фактичний порядок слів із тим, як мала б поводитися модель із увімкненим маркуванням.

Anthropic використовує версію підходу SynthID-Text від Google DeepMind. У первинній науковій роботі технологію описано як масштабований метод маркування текстів великих мовних моделей. Він не додає до відповіді спеціального рядка, пробілів нульової ширини чи іншого вмісту, який можна знайти через «показати приховані символи».

  1. Claude визначає набір прийнятних наступних токенів.
  2. Коли кілька варіантів не шкодять змісту, ключ впливає на випадковий вибір між ними.
  3. Повторення таких виборів утворює непомітний статистичний сигнал.
  4. Детектор аналізує достатньо довгий уривок і повертає оцінку ймовірності, а не абсолютне «так» або «ні».

За твердженням Anthropic, маркування не потребує додаткових токенів, майже не впливає на швидкість і не робить використання моделі дорожчим. Компанія також повідомляє, що у внутрішніх тестах не побачила практичного погіршення змісту, творчості чи читабельності. Це важливі дані провайдера, але вони не означають однакової надійності детектора для кожної мови, довжини або типу тексту.

Схема статистичного водяного знака в тексті Claude та його перевірки
Водяний знак міститься не в прихованих символах, а в статистичній послідовності вибраних моделлю слів.

Що детектор зможе визначити

Перевірка відповідає на вузьке питання: наскільки ймовірно, що цей уривок частково створювався Claude з конкретним водяним знаком. Що довший і різноманітніший текст, то більше в ньому контрольованих виборів і то вищою може бути впевненість. Водночас оцінка залишається статистичною та залежить від довжини, типу матеріалу, редагування, мови й порога детектора.

Водяний знак може бути сигналом, що:

  • Claude створив значну частину довгого уривка;
  • Claude істотно переписав початковий матеріал;
  • переклад був безпосередньо згенерований Claude;
  • текст після легкого редагування все ще зберігає достатню частину статистичного шаблону.

Він не може довести:

  • хто саме відкрив Claude або кому належав акаунт;
  • з якого чату, організації чи пристрою походить відповідь;
  • що весь документ написаний ШІ без участі людини;
  • що уривок без сигналу обов’язково створила людина;
  • чи використовувалася інша модель із власним ключем або іншим методом маркування;
  • чи є факти правильними, а цитати — справжніми;
  • хто має авторські права або несе юридичну відповідальність.

У водяному знаку немає ідентифікатора людини, компанії або розмови. Anthropic стверджує, що за ключем неможливо відновити інформацію про користувача. Маркування також не змінює умови володіння результатом і не знімає відповідальності з того, хто вирішив опублікувати текст.

Де перевірка слабшає

Короткі уривки. Короткий уривок може містити надто мало виборів, щоб упевнено відрізнити закономірність від випадкового збігу. Висока або низька оцінка для короткого повідомлення потребує особливо обережної інтерпретації.

Фактичні відповіді. У назві, даті, формулі чи визначенні модель часто не має свободи для безпечної заміни слів. Водяний знак навмисно не повинен змушувати Claude обирати менш точний варіант лише заради сильнішого сигналу.

Код. Назви функцій, оператори, синтаксис і значна частина логіки мають бути точними. Сигнал може з’являтися в коментарях або поясненнях, але в самому коді можливостей для нього менше.

Коректура. Якщо людина просить виправити лише кілька ком і помилок, майже всі слова залишаються її власними. Невеликої кількості змін може бути недостатньо для виявлення участі Claude.

Сильне переписування. Anthropic очікує, що легка редактура не завжди видалить сигнал, але повна заміна формулювань здатна його зруйнувати. У описі SynthID-Text Google також зазначає, що впевненість може суттєво впасти після ретельного переписування або перекладу вже готового позначеного тексту.

Редагування і переклад: два різні сценарії

Якщо Claude генерує переклад із нуля, він обирає практично кожне слово цільовою мовою, тому Anthropic очікує наявність водяного знака. Інша ситуація виникає, коли вже позначений англійський текст перекладає людина або інший сервіс: первинна послідовність слів змінюється, і детектор старого сигналу може втратити впевненість.

Так само слід розрізняти коректуру і співавторство. Виправлення орфографії не робить увесь документ «написаним Claude», тоді як повне переформулювання розділів залишає моделі значно більше виборів. Навіть позитивний результат не пояснює, який із цих процесів відбувся: Anthropic прямо зазначає, що водяний знак не відрізняє «Claude написав» від «Claude сильно відредагував».

Чим це відрізняється від звичайних AI-детекторів

Більшість доступних детекторів не має секретного ключа моделі. Вони оцінюють стиль, передбачуваність, довжину речень, повторювані конструкції та інші статистичні ознаки. Такий класифікатор може сприйняти формальний людський текст як машинний або не помітити добре відредаговану відповідь ШІ. Результат часто змінюється залежно від мови, жанру й довжини.

Перевірка водяного знака вужча, зате прив’язана до сигналу, який провайдер створив під час генерації. Це не робить її безпомилковою: сигнал може бути слабким, уривок коротким, а текст зміненим. Поки Anthropic не відкрила API та документацію з порогами, частотою хибних спрацьовувань, підтримуваними мовами й версіями моделей, незалежно перевірити роботу саме її реалізації неможливо.

Детектор також не перевіряє факти. Навіть технічно підтверджений текст Claude може містити помилку, а людський — вигадку. Для змісту потрібен окремий процес: знайти першоджерело, перевірити дату і контекст та скористатися нашим матеріалом про те, як перевіряти відповіді ШІ.

Для підтримуваних файлів Claude використовуватиметься C2PA

Для підтримуваних файлів, зокрема PNG, JPG і SVG, Anthropic описує інший механізм. До метаданих додаватиметься криптографічно підписана позначка за відкритим стандартом C2PA Content Credentials. Сумісний інструмент зможе прочитати відомості про те, що Claude створив або обробив файл.

Це не той самий сигнал, що в тексті: Content Credential є записом про походження в структурі файла, тоді як текстовий водяний знак закладений у статистику вибору слів. Позначка також не називає конкретну людину і не доводить, що весь вміст створено без людської участі. Відсутність C2PA-запису сама по собі не підтверджує справжність, тому перевірка походження доповнює, але не замінює візуальний і контекстний аналіз. Практичні кроки є в нашому гайді про те, як розпізнати дипфейк.

Чому зміна з’явилася після 2 серпня

Європейська комісія пояснює, що вимоги Article 50 AI Act щодо прозорості почали застосовуватися 2 серпня 2026 року. Провайдери, на яких поширюються ці правила, мають забезпечити машинозчитуване й технічно надійне маркування охопленого штучно створеного або зміненого контенту з урахуванням передбачених законом винятків і перехідних правил.

Anthropic та інші компанії підписали Кодекс практики щодо прозорості AI-контенту. Сам кодекс є добровільним шляхом демонстрації відповідності, але законодавчі вимоги Article 50 не є добровільними. Окремі обов’язки можуть стосуватися видимого розкриття дипфейків і AI-текстів про питання суспільного інтересу. Для власників сайтів, фрилансерів і малих команд ми вже підготували практичний чекліст прозорості AI Act.

Як відповідально використовувати результат перевірки

Для шкіл і університетів

Не варто автоматично карати учня лише через один відсоток у детекторі. Спочатку потрібно перевірити довжину уривка, правила конкретного завдання, дозволені способи редагування та можливість хибного результату. Корисніші докази процесу — чернетки, нотатки, список джерел, історія версій і коротке усне пояснення власних аргументів.

Для роботодавців

Політика має відрізняти генерацію нового документа від перекладу, перевірки граматики або дозволеного пошуку ідей. Позитивний сигнал може започаткувати розмову про процес, але не встановлює витік даних, порушення договору чи автора. Не завантажуйте конфіденційні документи до випадкового стороннього детектора без перевірки його політики приватності та строків зберігання даних.

Для редакцій і сайтів

Водяний знак не замінює редактора. Потрібно перевіряти першоджерела, цитати, числа, дати, права на медіа й відповідність заголовка тексту. Зберігайте історію змін і визначайте людину, яка відповідає за публікацію. Технічне маркування показує можливу участь інструмента, але не якість журналістської роботи.

Поширені запитання

Чи вже всі тексти Claude мають водяний знак?

Ні. Anthropic оголосила про маркування майбутніх моделей і поступове охоплення старіших. Не можна автоматично вважати позначеною кожну відповідь, створену до або одразу після оголошення.

Чи можна знайти водяний знак через пошук прихованих символів?

Ні. У текст нічого не дописується. Сигнал міститься в статистичному шаблоні вибраних слів і потребує спеціального детектора з ключем.

Чи показує він ім’я користувача Claude?

Ні. За описом Anthropic, маркування не містить ідентифікатора користувача, організації, акаунта або чату.

Чи буде позначений текст після перекладу?

Переклад, який безпосередньо створює Claude з увімкненим маркуванням, має містити його сигнал. Переклад уже готового тексту іншою людиною або системою може послабити чи знищити первинний шаблон.

Де перевірити текст просто зараз?

Anthropic лише анонсувала майбутній API перевірки. До його запуску сторонній сервіс не може достовірно заявляти, що використовує закритий ключ Anthropic, якщо компанія не підтвердила таку інтеграцію.

Висновок

Водяний знак Claude є технічним сигналом походження, а не тестом на чесність. Він може допомогти визначити ймовірну участь Claude з увімкненим водяним знаком у достатньо довгому тексті, не додаючи прихованих символів і не розкриваючи особу користувача. Проте короткі, фактичні, відредаговані та перекладені матеріали залишають багато невизначеності.

Найбезпечніший підхід — поєднувати технічну перевірку з доказами робочого процесу, аналізом джерел і людською відповідальністю. Після запуску API важливими стануть не тільки сама кнопка «перевірити», а й опубліковані пороги, підтримувані мови, частота хибних результатів та правила використання оцінки в реальних рішеннях.

Обговорення

Долучайтеся до розмови

Пишіть по суті й поважайте інших читачів. Перший коментар може з’явитися після перевірки редакцією.

Залишити коментар

Ваш email не публікується. Поля зі зірочкою обов’язкові.

Надсилаючи коментар, ви погоджуєтеся на його перевірку та зберігання введених даних відповідно до політики конфіденційності.