Водяні знаки в LLM спричиняють дрейф вибірки та помилки виклику інструментів
Генеративні водяні знаки, такі як SynthID-Text від Google DeepMind, модифікують вибірку токенів під час інференсу, спричиняючи дрейф семплювання. Навіть у базовому режимі це призводить до зміни викликів інструментів та аргументів у середньому в 6,5% випадків.

Вплив: Високий
Чому це важливо
Варто протестувати виклики інструментів при роботі з маркованими API, щоб запобігти прихованому спотворенню шляхів та параметрів функцій.
TL;DR
- 01Неспотворювальні водяні знаки зберігають математичний розподіл токенів, але змінюють генерацію при фіксованому ключі.
- 02Агрегована точність маскує регресії: середня розбіжність парних генерацій становить 6,5%, досягаючи 16,8%.
- 03Синтаксис JSON залишається коректним, тоді як динамічні параметри (шляхи файлів, суми операцій) змінюються без помилок парсингу.
Ключові факти
- Середня розбіжність виклику інструментів
- 6,5% у 21 тестовій конфігурації
- Рівень розбіжності Phi-4 (T=1.0)
- 16,8% (падіння точності: 2,87%)
- Рівень розбіжності Llama-3.1-8B (T=1.0)
- 9,9% (падіння точності: 0,87%)
- Конфігурація процесора SynthID
- 30 шарів турніру, n-грам 5, контекст 1024
Прихована ціна маркування в агентних середовищах
Згідно зі статтею 50(2) регламенту EU AI Act, постачальники ШІ-систем зобов'язані маркувати синтетичний текст у машиночитаному форматі. Anthropic застосовує технологію SynthID-Text від Google DeepMind у моделях Claude. Хоча алгоритм формально є 'non-distortionary' і зберігає розподіл токенів у математичному сподіванні, дослідження Lasso Security виявило феномен дрейфу вибірки (sampling drift), який безпосередньо ламає детерміновану роботу агентів.
Нестабільність рішень проти агрегованої точності
Тестування на бенчмарку BFCL v4 для виклику функцій (21 комбінація моделей і температур) зафіксувало середній рівень розбіжності парних результатів у 6,5%. За температури T=1.0 у моделі Phi-4 частка змінених вердиктів сягнула 16,8% при падінні загальної точності лише на 2,87%. У Llama-3.1-8B розбіжність становила 9,9% за падіння точності на 0,87%. Агреговані метрики приховують проблему, оскільки виправлені випадкові виклики маскують поламані функції.
Ризики виконання хибних аргументів
На відміну від синтаксичних збоїв, дрейф семплювання формує валідний JSON зі зміненими значеннями параметрів. В експериментах з SynthIDTextWatermarkLogitsProcessor (30 шарів турніру, довжина n-грам 5, історія контексту 1 024) мутацій зазнавали шляхи до файлів, суми транзакцій та SQL-запити. Для розробників автономних агентів це створює загрозу виконання непередбачених операцій із валідним синтаксисом в обхід базової валідації схем.
Спробуй за 2 хвилини
from transformers.generation import SynthIDTextWatermarkLogitsProcessor
# Test agent prompt drift with Hugging Face's SynthID processor
watermark_processor = SynthIDTextWatermarkLogitsProcessor(
keys=[12345, 67890],
ngram_len=5,
context_history_size=1024,
)
# Pass in generation: model.generate(inputs, logits_processor=[watermark_processor])python
✓ Коли використовувати
- При оцінці постачальників LLM, які впроваджують вимоги EU AI Act Article 50(2) на рівні моделі.
- Під час створення захисних механізмів валідації аргументів в автономних агентах.
Що зробити сьогодні
- Додайте обов'язкову перевірку аргументів під час виконання (regex для шляхів, діапазони чисел), не покладаючись лише на валідність JSON.
- Протестуйте пайплайн виклику функцій локально за допомогою SynthIDTextWatermarkLogitsProcessor для оцінки рівня дрейфу аргументів.
- Знижуйте температуру генерації (T < 0.2) для агентів при виклику маркованих API, щоб мінімізувати вплив турнірної вибірки.
Джерела