OpenAI внедряет невидимые текстовые водяные знаки в ответы ChatGPT и Codex. Обновление коснется пользователей из Евросоюза — на всех тарифах. Также маркировку для некоторых моделей могут включать и клиенты API по всему миру, сообщается в блоге компании.
|
Обновление |
Текстовые водяные знаки textGrain в ответах ChatGPT и Codex |
|
В чем суть |
Технология textGrain добавляет статистический сигнал к выбору слов моделью, детектор ищет его, чтобы определить происхождение текста |
|
Где работает |
|
|
Когда появится |
|
|
Ограничения |
Короткие и отредактированные тексты распознаются хуже |
|
Предыдущая новость |
Как нейросеть добавляет водяной знак в сгенерированный текст в ChatGPT и Codex
Технология называется textGrain. Она добавляет сигнал к выбору слов моделью, а детектор определяет, есть ли в отрывке водяной знак OpenAI. Компания внедряет маркировку в соответствии с Законом ЕС об искусственном интеллекте: он требует, чтобы сгенерированный текст можно было идентифицировать машинным способом.
По тестам на модели Astra существенной разницы в качестве ответов с водяными знаками и без них нет.
Как будут работать невидимые водяные знаки в ChatGPT
Что уже известно о работе новой опции:
-
В текстовых ответах ChatGPT и Codex в Евросоюзе водяные знаки появятся в ближайшие недели.
-
В API опция по умолчанию будет отключена — ее включают по запросу. Клиенты сами решают, насколько водяные знаки соответствуют их обязательствам по прозрачности и пользовательскому опыту.
В OpenAI отметили, что водяные знаки в текстах не станут глобальным стандартом по умолчанию. Региональный подход, по словам компании, позволит учиться на реальных примерах и получать обратную связь.
Инструмент сообщит, обнаружен ли водяной знак OpenAI, но не будет идентифицировать пользователя или раскрывать его аккаунт, запросы и диалоги.
Насколько точно детектор определяет текст с водяным знаком OpenAI
По данным OpenAI, детектор может ошибочно находить маркировку или пропускать ее. Точность зависит от длины и типа текста. Чем короче текст, тем труднее его обнаружить. Например:
-
при целевом показателе ложных срабатываний в 1% детектор выявил водяные знаки примерно в 80% отрывков из 200 токенов и в 95% отрывков из 400 токенов в тестах по психологии;
-
в математике, где выбор слов менее разнообразен, показатели значительно ниже;
-
редактирование также ослабляет сигнал: замена 10% слов синонимами снижает вероятность обнаружения с 92% до 66%, а замена 25% — до 17%.
Отсутствие водяного знака не доказывает, что текст написал человек. Сам знак:
-
не показывает вклад человека;
-
не устанавливает авторство;
-
не проверяет точность текста.
Кто получит доступ к детектору водяных знаков нейросети
Доступ к детектору будет открываться в индивидуальном порядке. На старте его смогут получить только одобренные исследователи и экспертные организации по заявке. Компания не открывает инструмент публично из-за возможного пропуска водяных знаков и ложных срабатываний.
Ранее OpenAI объявила, что вернет подписку ChatGPT Pro и изменит расчет лимитов.
Возможно, вам будет интересно:
Источник: блог OpenAI