Дистиляція меж запитів знижує хибні відмови великих мовних моделей до чотирьох відсотків
Команда Multiverse Computing представила метод самодистиляції на межах тем, що запобігає відхиленню безпечних запитів зі спільною лексикою. Завдяки додаванню тренувальних даних на межі дозволеного рівень надмірних відмов знизився з 32,9% до 4,2%.

Вплив: Середній
Чому це важливо
Стандартне налаштування безпеки діє надто грубо, відхиляючи безпечні запити лише через наявність чутливих слів. Навчання з урахуванням меж зберігає корисність моделі для легітимних завдань без послаблення захисних бар'єрів.
TL;DR
- 01Налаштування безпеки лише на блокування шкоди здатне збільшити частку хибних відмов на безпечних запитах до 74%.
- 02Стратегія повторних спроб генерації з ескалацією знижує втрату складних навчальних прикладів із 19,88% до 0,20%.
- 03Додавання безпечних даних на межі теми скорочує хибні відмови на тестових парах із 32,94% до 4,16% за збереження 87,72% блокувань небезпечних запитів.
Ключові факти
- Зниження надмірних відмов (граничні дані)
- з 32,94% до 4,16%
- Збережений рівень відмов на небезпечних запитах
- 87,72% (проти 91,88%)
- Скорочення втрат при навчанні
- з 19,88% до 0,20% завдяки ескалації
- Середня частка небезпечних відповідей (HarmBench, StrongREJECT, WildJailbreak)
- з 26,26% до 0,14%
Пастка надмірних відмов під час вирівнювання
Стандартні пайплайни безпеки змушують модель блокувати цілі тематичні домени. На моделі Qwen3-8B базова оптимізація знизила середній рівень небезпечних відповідей у трьох бенчмарках (HarmBench, StrongREJECT та WildJailbreak) з 26,26% до 0,14%. Проте надмірні відмови на безпечних запитах у тесті XSTest підскочили з 2,00% до 74,00%.
Архітектура контрастних меж
Щоб навчити модель розрізняти намір, Multiverse Computing впровадила три покращення у підготовку датасетів:
1. Ескалація покриття: Однопрохідна генерація відкидала 19,88% складних промптів. Покрокове посилення інструкцій скоротило втрати до 0,20% (лише 79 запитів), зберігши 40 293 приклади для навчання. 2. Власні валідовані відповіді: Заміна зовнішніх датасетів згоди на відповіді самої цільової моделі зменшила відмови в XSTest з 15,20% до 5,20%. 3. Граничні безпечні дані: Додавання тренувальних даних на межі дозволеного скоротило хибні блокування легітимних запитів на тестовому наборі з 1539 контрастних пар із 32,94% до 4,16%, зберігши блокування шкідливих промптів на рівні 87,72% (проти 91,88%).
Баланс метрик
Оцінка безпеки лише за відсотком блокування спотворює реальну картину. Одночасне тестування обох сторін межі доводить, що продумана композиція даних зберігає практичну цінність моделі без втрати захисту.
✓ Коли використовувати
- Розгортання моделей у доменах на кшталт політики, юриспруденції чи медицини, де безпечні запити містять чутливі слова.
- Калібрування політики відмов, коли стандартні фільтри викликають неприпустиму частку хибних спрацьовувань.