Перейти до вмісту
ГоловнаНовиниДайджестиКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS

Слідкуйте за AI Today Brief у LinkedIn — щоденні оновлення з AI-інженерії та тижневий PDF «5 shifts that changed how developers work».

Огляд

НовиниДайджестиКонцептиГайди

Компанія

ПідписатисяРекламаПро нас

Правове

Редакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Моделі й дослідження/
  4. Дистиляція меж запитів знижує хибні відмови великих мовних моделей до чотирьох відсотків
Моделі й дослідження

Дистиляція меж запитів знижує хибні відмови великих мовних моделей до чотирьох відсотків

Команда Multiverse Computing представила метод самодистиляції на межах тем, що запобігає відхиленню безпечних запитів зі спільною лексикою. Завдяки додаванню тренувальних даних на межі дозволеного рівень надмірних відмов знизився з 32,9% до 4,2%.

9 вересня 2026 р.· 5 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 9 вересня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Дистиляція меж запитів знижує хибні відмови великих мовних моделей до чотирьох відсотків

Вплив: Середній

Чому це важливо

Стандартне налаштування безпеки діє надто грубо, відхиляючи безпечні запити лише через наявність чутливих слів. Навчання з урахуванням меж зберігає корисність моделі для легітимних завдань без послаблення захисних бар'єрів.

TL;DR

  • 01Налаштування безпеки лише на блокування шкоди здатне збільшити частку хибних відмов на безпечних запитах до 74%.
  • 02Стратегія повторних спроб генерації з ескалацією знижує втрату складних навчальних прикладів із 19,88% до 0,20%.
  • 03Додавання безпечних даних на межі теми скорочує хибні відмови на тестових парах із 32,94% до 4,16% за збереження 87,72% блокувань небезпечних запитів.

Ключові факти

Зниження надмірних відмов (граничні дані)
з 32,94% до 4,16%
Збережений рівень відмов на небезпечних запитах
87,72% (проти 91,88%)
Скорочення втрат при навчанні
з 19,88% до 0,20% завдяки ескалації
Середня частка небезпечних відповідей (HarmBench, StrongREJECT, WildJailbreak)
з 26,26% до 0,14%

Пастка надмірних відмов під час вирівнювання

Стандартні пайплайни безпеки змушують модель блокувати цілі тематичні домени. На моделі Qwen3-8B базова оптимізація знизила середній рівень небезпечних відповідей у трьох бенчмарках (HarmBench, StrongREJECT та WildJailbreak) з 26,26% до 0,14%. Проте надмірні відмови на безпечних запитах у тесті XSTest підскочили з 2,00% до 74,00%.

Архітектура контрастних меж

Щоб навчити модель розрізняти намір, Multiverse Computing впровадила три покращення у підготовку датасетів:

1. Ескалація покриття: Однопрохідна генерація відкидала 19,88% складних промптів. Покрокове посилення інструкцій скоротило втрати до 0,20% (лише 79 запитів), зберігши 40 293 приклади для навчання. 2. Власні валідовані відповіді: Заміна зовнішніх датасетів згоди на відповіді самої цільової моделі зменшила відмови в XSTest з 15,20% до 5,20%. 3. Граничні безпечні дані: Додавання тренувальних даних на межі дозволеного скоротило хибні блокування легітимних запитів на тестовому наборі з 1539 контрастних пар із 32,94% до 4,16%, зберігши блокування шкідливих промптів на рівні 87,72% (проти 91,88%).

Баланс метрик

Оцінка безпеки лише за відсотком блокування спотворює реальну картину. Одночасне тестування обох сторін межі доводить, що продумана композиція даних зберігає практичну цінність моделі без втрати захисту.

✓ Коли використовувати

  • Розгортання моделей у доменах на кшталт політики, юриспруденції чи медицини, де безпечні запити містять чутливі слова.
  • Калібрування політики відмов, коли стандартні фільтри викликають неприпустиму частку хибних спрацьовувань.
#Qwen3-8B#LlamaGuard-3#HarmBench#StrongREJECT#WildJailbreak#XSTest
ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаNVIDIA випустила нативний інструментарій CUDA Rust для розробки GPU-кернелівНаступна новина →Meta випустила автономного персонального агента Muse з ізольованою пісочницею

Схожі матеріали

  • Моделі й дослідженняAnthropic випустила згенерований ШІ-агентами доказ великої теореми Ферма в Lean 4
  • Моделі й дослідженняInclusionai випустила відкриту MoE-модель Ling-3.0-flash на 124 мільярди параметрів
  • Моделі й дослідженняМультимодальні енкодери NeoMME забезпечують візуальний пошук документів зі швидкістю 51 сторінка на секунду
  • Моделі й дослідженняAnthropic випустила Claude Fable 5.1 зі зниженою ціною читання кешу промптів

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.