AI-безопасность · конспект по субтитрам
AI теперь оставляет след — но вы о нём не знаете
Подробный конспект механизма водяного знака в AI-тексте: выбор токенов по секретному ключу, вероятностный детектор, слабые места метода и отличие от C2PA-метаданных файлов.
Главное за минуту
- В текст не добавляются скрытые символы: след возникает из последовательности выбранных слов
- Детектор должен уметь отвечать не только «да» или «нет», но и «недостаточно данных»
- Короткие, фактические и отредактированные тексты несут более слабый сигнал
- Найденная метка говорит об участии модели, но не доказывает единоличное авторство
Разбор по главам
Нажмите на таймкод, чтобы открыть соответствующий фрагмент оригинального видео.
Водяной знак живёт в выборе слов
На примере равнозначных продолжений фразы объясняется главная идея: модель не добавляет в текст секретный символ, а воспроизводимо выбирает один из нескольких нормальных вариантов. Поэтому обычное копирование не уничтожает след.
- Для читателя оба варианта выглядят естественно.
- Проверяющая сторона ищет статистическую последовательность выборов.
Почему метка появилась
В ролике внедрение связывается с европейскими требованиями к машиночитаемой маркировке генеративного контента. Отдельно подчёркивается, что глобальное включение проще регионального разделения.
- Механизм рассматривается как compliance-требование, а не пользовательская функция.
- Один региональный норматив может фактически повлиять на глобальную выдачу модели.
Что не является водяным знаком
Отсекаются три частых заблуждения: это не символы нулевой ширины, не приклеенные к тексту метаданные и не стилистический AI-детектор. Проверка строится по секретному ключу, а не по привычкам модели.
- Скрытые символы легко обнаружить и удалить вставкой без форматирования.
- Стилистические детекторы могут ошибочно обвинять аккуратно пишущего человека.
Как меняется генерация
Модель поочерёдно оценивает возможные следующие токены. Водяной знак не добавляет плохие варианты, а заменяет случайный выбор среди уже допустимых кандидатов воспроизводимой функцией от ключа и предыдущего контекста.
- Редкие и неуместные слова не должны специально попадать в ответ.
- Аналогия из ролика — партия в настольную игру, где броски берутся из известной только проверяющему последовательности.
SynthID на уровне логитов
Техническая часть описывает logits processor: после отсечения маловероятных кандидатов специальная функция ранжирует финалистов с учётом секретного ключа и предыдущих токенов. Сила метки настраивается количеством слоёв и длиной учитываемого контекста.
- Больше контекста улучшает детектирование, но делает сигнал чувствительнее к правкам.
- Для внедрения не требуется переобучать или дообучать модель.
Детектор и три возможных ответа
Детектор выдаёт вероятностный результат: метка есть, метки нет или данных недостаточно. Порогами можно менять баланс между ложными срабатываниями и пропусками; публичный детектор при этом упростил бы подбор правок для удаления сигнала.
- Неопределённый результат — нормальная часть метода, а не ошибка системы.
- В ролике наиболее разумным называется доступ к проверке через API без публикации ключа.
Где метод слабеет
Сигнал хуже виден в коротких текстах, фактических формулировках и коде, потому что там мало равнозначных вариантов. Лёгкая вычитка чужого текста тоже оставляет модели слишком мало собственных выборов.
- Полностью сгенерированный перевод, наоборот, даёт модели много точек выбора.
- Глубокая перепись может разрушить метку, но тогда человек фактически заново создаёт текст.
Файлы используют C2PA
Для поддерживаемых изображений и других файлов применяется другой механизм: криптографически подписанная запись о происхождении в метаданных C2PA. Она проверяема, но может исчезнуть после скриншота, конвертации или обработки соцсетью.
- Текстовый знак сравнивается с акцентом в речи, а C2PA — с паспортом файла.
- Потеря метаданных не означает, что подпись была подделана.
Что можно и нельзя доказать
Наличие сигнала указывает лишь на вероятное участие модели: она могла создать, перевести или серьёзно отредактировать текст. Отсутствие сигнала также ничего не доказывает из-за длины, правок, другой модели или старой версии.
- Метка не содержит данных о конкретном пользователе или его организации.
- Метод нельзя использовать как безусловное доказательство авторства или вины.
От детекции к происхождению
Финальная мысль ролика: индустрия постепенно переходит от попытки угадать AI-текст по стилю к инфраструктуре происхождения контента. Такая система лучше подтверждает участие модели, чем отвечает на вопрос, писал ли текст человек.
- Подпись источника полезнее стилистического угадывания.
- Ключевой будущий вопрос — кто и на каких условиях получает доступ к проверке.