Все бесплатные ресурсы

AI-безопасность · конспект по субтитрам

AI теперь оставляет след — но вы о нём не знаете

Подробный конспект механизма водяного знака в AI-тексте: выбор токенов по секретному ключу, вероятностный детектор, слабые места метода и отличие от C2PA-метаданных файлов.

Главное за минуту

  • В текст не добавляются скрытые символы: след возникает из последовательности выбранных слов
  • Детектор должен уметь отвечать не только «да» или «нет», но и «недостаточно данных»
  • Короткие, фактические и отредактированные тексты несут более слабый сигнал
  • Найденная метка говорит об участии модели, но не доказывает единоличное авторство

Разбор по главам

Нажмите на таймкод, чтобы открыть соответствующий фрагмент оригинального видео.

Водяной знак живёт в выборе слов

На примере равнозначных продолжений фразы объясняется главная идея: модель не добавляет в текст секретный символ, а воспроизводимо выбирает один из нескольких нормальных вариантов. Поэтому обычное копирование не уничтожает след.

  • Для читателя оба варианта выглядят естественно.
  • Проверяющая сторона ищет статистическую последовательность выборов.

Почему метка появилась

В ролике внедрение связывается с европейскими требованиями к машиночитаемой маркировке генеративного контента. Отдельно подчёркивается, что глобальное включение проще регионального разделения.

  • Механизм рассматривается как compliance-требование, а не пользовательская функция.
  • Один региональный норматив может фактически повлиять на глобальную выдачу модели.

Что не является водяным знаком

Отсекаются три частых заблуждения: это не символы нулевой ширины, не приклеенные к тексту метаданные и не стилистический AI-детектор. Проверка строится по секретному ключу, а не по привычкам модели.

  • Скрытые символы легко обнаружить и удалить вставкой без форматирования.
  • Стилистические детекторы могут ошибочно обвинять аккуратно пишущего человека.

Как меняется генерация

Модель поочерёдно оценивает возможные следующие токены. Водяной знак не добавляет плохие варианты, а заменяет случайный выбор среди уже допустимых кандидатов воспроизводимой функцией от ключа и предыдущего контекста.

  • Редкие и неуместные слова не должны специально попадать в ответ.
  • Аналогия из ролика — партия в настольную игру, где броски берутся из известной только проверяющему последовательности.

SynthID на уровне логитов

Техническая часть описывает logits processor: после отсечения маловероятных кандидатов специальная функция ранжирует финалистов с учётом секретного ключа и предыдущих токенов. Сила метки настраивается количеством слоёв и длиной учитываемого контекста.

  • Больше контекста улучшает детектирование, но делает сигнал чувствительнее к правкам.
  • Для внедрения не требуется переобучать или дообучать модель.

Детектор и три возможных ответа

Детектор выдаёт вероятностный результат: метка есть, метки нет или данных недостаточно. Порогами можно менять баланс между ложными срабатываниями и пропусками; публичный детектор при этом упростил бы подбор правок для удаления сигнала.

  • Неопределённый результат — нормальная часть метода, а не ошибка системы.
  • В ролике наиболее разумным называется доступ к проверке через API без публикации ключа.

Где метод слабеет

Сигнал хуже виден в коротких текстах, фактических формулировках и коде, потому что там мало равнозначных вариантов. Лёгкая вычитка чужого текста тоже оставляет модели слишком мало собственных выборов.

  • Полностью сгенерированный перевод, наоборот, даёт модели много точек выбора.
  • Глубокая перепись может разрушить метку, но тогда человек фактически заново создаёт текст.

Файлы используют C2PA

Для поддерживаемых изображений и других файлов применяется другой механизм: криптографически подписанная запись о происхождении в метаданных C2PA. Она проверяема, но может исчезнуть после скриншота, конвертации или обработки соцсетью.

  • Текстовый знак сравнивается с акцентом в речи, а C2PA — с паспортом файла.
  • Потеря метаданных не означает, что подпись была подделана.

Что можно и нельзя доказать

Наличие сигнала указывает лишь на вероятное участие модели: она могла создать, перевести или серьёзно отредактировать текст. Отсутствие сигнала также ничего не доказывает из-за длины, правок, другой модели или старой версии.

  • Метка не содержит данных о конкретном пользователе или его организации.
  • Метод нельзя использовать как безусловное доказательство авторства или вины.

От детекции к происхождению

Финальная мысль ролика: индустрия постепенно переходит от попытки угадать AI-текст по стилю к инфраструктуре происхождения контента. Такая система лучше подтверждает участие модели, чем отвечает на вопрос, писал ли текст человек.

  • Подпись источника полезнее стилистического угадывания.
  • Ключевой будущий вопрос — кто и на каких условиях получает доступ к проверке.

Продолжите с файлами и поддержкой

В Pro доступны исходники, скиллы, мастер-классы и обсуждение ваших задач с участниками сообщества.

Вступить в Pro