Перейти до вмісту
ATAI Today Brief
ГоловнаНовиниКонцептиГайдиІнструменти
Про насПідписатисяEN
Підписатися

AI Today Brief

Щоденний бриф з AI-інженерії. Built in public. EN · UA.

XTelegramLinkedInYouTubeRSS
НовиниДайджестиКонцептиГайдиПідписатисяРекламаПро насРедакційна політикаAI-розкриттяПриватністьУмови

© 2026 AI Today Brief. Усі права захищені.

  1. Головна/
  2. Новини/
  3. Гайди й туторіали/
  4. Додаткове навчання великої мовної моделі для документації в ретро-стилі
Гайди й туторіали

Додаткове навчання великої мовної моделі для документації в ретро-стилі

5 червня 2026 р.· 6 хв читання
OKКуратор Oleksandr Kuzmenko, AI Product Engineer·Оновлено 5 червня 2026 р.·Джерела вказані в кожному матеріалі
За участі AI · перевірено редактором·Як ми використовуємо AI
Додаткове навчання великої мовної моделі для документації в ретро-стилі

Нещодавній проект демонструє, як додатково навчити велику мовну модель (LLM) генерувати технічну документацію, що нагадує стильові посібники 1990-х років. Це креативне застосування показує універсальність LLM у прийнятті специфічних стилістичних конвенцій, виходячи за рамки стандартної генерації тексту, пропонуючи посібник для розробників, зацікавлених у власних поведінкових моделях.

Чому це важливо

Вивчіть практичні техніки додаткового навчання, щоб надати LLM унікальні стилістичні вихідні дані, корисні для брендингу, творчого контенту або спеціалізованої генерації документів.

TL;DR

  • 01Додаткове навчання дозволяє LLM приймати специфічні стилістичні вихідні дані.
  • 02Створіть цільовий набір даних для навчання власних стилів письма.
  • 03Застосовуйте це до брендингу, творчого контенту або спеціалізованої документації.

Ключові факти

Обсяг навчального корпусу
37+ млн слів (колекція Microsoft на Bitsavers)
Кількість зразків у датасеті
192,456 JSONL прикладів
Обчислювальне обладнання
Nvidia B200 (192GB пам'яті) на Runpod
Вартість налаштування
$50 ($8 на пре-очищення, <$6/год оренда B200)

Побудова корпусу текстів 1990-х років

Для відтворення стилю технічних інструкцій кінця XX століття дослідник викорисад колекцію Microsoft на сайті Bitsavers — архів відсканованих старих посібників, виданих між 1977 та 2005 роками, обсягом понад 37 мільйонів слів. Після базового очищення за допомогою Python-скриптів модель gemma-4-26b через OpenRouter відсортувала кожен абзац за критеріями 'залишити' або 'видалити' (процедура коштувала близько $8). Кінцевий набір даних містив 192 456 прикладів у форматі JSONL з обмеженням до 512 токенів на фрагмент.

Тонке налаштування з QLoRA на Runpod

Замість навчання з нуля, автор використав метод QLoRA (Quantized Low-Rank Adaptation) на графічних процесорах Nvidia B200 (192 ГБ пам'яті), орендованих на Runpod за ціною менше $6 на годину. Було протестовано моделі Llama 3.1 8B Instruct та Qwen 2.5 7B Instruct. Навчання кількох конфігурацій тривало близько одного дня і коштувало загалом $50. Отримані адаптери конвертували у формат GGUF для локального запуску в Ollama.

Тести та результати стилізації

Моделі оцінювали за трьома тестовими завданнями: опис С-функції malloc(), вигаданої Win32-функції ConnectWifi() та пояснення REST API у стилі Microsoft 90-х. Базові моделі генерували сучасний Markdown-формат, схожий на файли README, тоді як адаптовані версії успішно відтворювали історичну структуру з розділами 'Synopsis' та зберігали атмосферу старих SDK для Windows.

Спробуй за 2 хвилини

ollama run qwen2.5-7b-retro-docs

bash

✓ Коли використовувати

  • Стилістична адаптація, що вимагає специфічного тону або образу (наприклад, документація бренду)
  • Тонке налаштування відносно малих відкритих моделей (7B/8B) локально або на Runpod

✕ Коли НЕ варто

  • Сценарії, де точність вилучення фактів є критично важливою (краще використовувати RAG)
  • Вимоги високої швидкості роботи без затримок у реальному часі без GGUF-оптимізацій

Що каже спільнота

  • “Out of curiosity i just tried having the LLM generate a document describing the style, then (after a memory reset) i asked it to use the document and it did more or less the same job”

    — badsectoracula на Hacker News

ПоділитисяПоділитися в XПоділитися в LinkedIn
← Попередня новинаOpenAI Codex тепер підтримує розробку та тестування iOS-додатків у браузеріНаступна новина →Дослідження виявило, що агенти Claude демонструють обман, утворення картельних змов та агресію

Схожі матеріали

  • Гайди й туторіалиСтворення ШІ-агента, що самостійно розвивається, на менш ніж ста рядках Lisp

Email-дайджест

Отримуйте ранковий AI-бриф

Один лист на день — історії, що важливі для інженерів, фаундерів і техлідів. Редагує людина, з посиланнями на першоджерела.

  • ✓120+ джерел щодня
  • ✓Редагує людина
  • ✓1 лист на день
  • ✓EN + UA

Підписуючись, ви погоджуєтесь з політикою конфіденційності.