Фреймворк DeepMind StoryScope виявив структурні наративні патерни у провідних LLM
Дослідники DeepMind презентували StoryScope — фреймворк, який визначає згенерований штучним інтелектом текст із точністю 93.2% виключно за структурними наративними рішеннями. Бенчмарк виявив, що Claude демонструє пласку ескалацію подій, GPT зловживає плітками для сюжету, а Gemini використовує зовнішні описи персонажів.

Вплив: Середній
Чому це важливо
Ви можете налаштувати промпти у генеративних сценаріях для створення нелінійних сюжетів та усунення передбачуваних структурних штампів LLM.
TL;DR
- 01Зміна стилю не приховує ШІ-походження, якщо структура тексту залишається лінійною та спрощеною.
- 02Claude схильний до пласкої ескалації подій, що вимагає явних вказівок у промпті для створення динамічного сюжету.
- 03Додавання часових стрибків та дилем суттєво зменшує характерні для LLM структурні шаблони.
Ключові факти
- Точність виявлення F1 (лише структура)
- 93.2% macro-F1
- Точність атрибуції авторства
- 68.4% macro-F1 (6 моделей/людина)
- Розмір датасету
- 61 608 історій за 10 272 промптами
- Протестовані моделі
- Claude, DeepSeek, Gemini, GPT, Kimi
Виявлення ШІ на рівні нарративної структури
StoryScope оцінює структурні сюжетні рішення за 10 наративними вимірами на датасеті з 61 608 історій від Claude, DeepSeek, Gemini, GPT та Kimi. Навіть без урахування стилістики та лексики, самі лише структурні ознаки забезпечують 93.2% macro-F1 при виявленні ШІ.
Специфічні відбитки моделей
Кожна провідна LLM має характерні структурні викривлення: Claude демонструє пласку ескалацію подій, GPT часто використовує плітки як рушій сюжету, а Gemini зловживає зовнішніми описами персонажів. Людські тексти показують вищу різноманітність та нелінійну часову структуру.
Спробуй за 2 хвилини
git clone https://github.com/jenna-russell/storyscopebash
✓ Коли використовувати
- Під час оцінки якісних характеристик синтетичного тексту та аналізу датасетів на наявність LLM-шаблонів.
- При розробці складних промптів для підвищення структурної різноманітності створеного контенту.
✕ Коли НЕ варто
- Не підходить для перевірки граматики або коротких фрагментів коду.
- Не використовується для коротких відповідей розміром менше 500 слів.
Що зробити сьогодні
- Оновіть промпти генерації контенту вимогами щодо нелінійної хронології та складного розвитку сюжету.
- Перегляньте відкритий репозиторій StoryScope для аудиту структурних метрик у датасетах.
Джерела