Перейти до вмісту
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Як працює статистичне маркування LLM і чому легкий парафраз його не видаляє
Моделі й дослідження

Як працює статистичне маркування LLM і чому легкий парафраз його не видаляє

Інтерактивний аналіз показує, як моделі Claude та Gemini вбудовують статистичні водяні знаки через зміщення ймовірностей токенів за допомогою секретних ключів. Детекція спирається на k-gram вікна, тому лише повний семантичний перепис видаляє маркування.

17 серпня 2026 р.· 4 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 17 серпня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Як працює статистичне маркування LLM і чому легкий парафраз його не видаляє

Вплив: Середній

Чому це важливо

Зрозумійте принцип роботи водяних знаків при семплінгу моделей та чому детекція на основі вікон стійка до поверхневих редагувань.

TL;DR

  • 01Водяні знаки вбудовуються під час семплінгу токенів без додавання метаданих чи зміни символів.
  • 02Для перевірки статистичного зміщення детектору необхідний приватний ключ провайдера.
  • 03Лише повний семантичний перепис руйнує суміжні n-gram вікна достатньо для скидання детекції.

Ключові факти

Вцілілі вікна KGW
0.5% після повного перепису
Поріг детекції
~1500 слів для слабкого зміщення
Власність ключа
Необхідний ключ провайдера

Семплінг токенів та секретні ключі

Під час генерації речень мовна модель вибирає наступні токени з короткаго списку кандидатів. Алгоритми маркування використовують секретний ключ на основі попередніх слів, щоб розділити кандидати на червоні та зелені, зміщуючи ймовірність на користь останніх.

Механіка детекції та пороги контексту

Детекція не спирається на стилістичні припущення, а перераховує кольори токенів за допомогою ключа:

  • Короткі тексти та код: Не мають достатньої варіативності для надійного вбудовування маркування.
  • Довгі тексти (>1500 слів): Забезпечують високу статистичну точність навіть при мінімальному зміщенні ймовірностей.
  • Легкий парафраз: Не видаляє маркування, оскільки суміжні n-gram вікна залишаються недоторканими.
  • Повний семантичний перепис: Видаляє маркер, руйнуючи понад 99.5% оригінальних послідовностей токенів.

✓ Коли використовувати

  • Для оцінки того, чи видаляє поверхневе редагування слід маркування LLM
  • При побудові систем аудиту та верифікації штучно згенерованої документації

✕ Коли НЕ варто

  • При аналізі вихідного коду або детермінованих структур даних з нульовою варіативністю токенів

Що зробити сьогодні

  • →Проведіть аудит автоматизованих сценаріїв генерації контенту, якщо потрібне повне семантичне переформулювання.
#Claude#Gemini#SynthID

Джерела

  • declaude Watermarking Visual Guide
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаCursor запускає хостинг коду Origin із двосторонньою синхронізацією GitHubНаступна новина →Декомпіляція застарілих бінарників за допомогою агентних воркфлоу Claude Code

Схожі матеріали

  • Моделі й дослідженняЗастарілі моделі Claude уразливі до багатокрокових промпт-ін'єкцій на сторонніх API
  • Моделі й дослідженняТаємнича модель Ox Alpha з'явилася на OpenRouter, випереджаючи Fable 5 та GPT-5.6 Sol
  • Моделі й дослідженняВідкрита модель Ornith-1.5 на 397B MoE випущена під ліцензією MIT
  • Моделі й дослідженняCanonical підтримує нейросимвольне ШІ-дослідження для автоматизації перекладу C на Rust

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.