Датасет: собрать, разметить, проверить
Датасет — это не «много данных», а набор примеров того, что вы хотите получать от модели. Качество датасета определяет результат сильнее, чем выбор модели и параметров вместе взятые.
Формат зависит от задачи
| Задача | Пример строки | Формат |
|---|---|---|
| Дообучение LLM | {«messages»: [system, user, assistant]} | JSONL |
| Классификация текстов | текст; метка | CSV |
| Предсказание по таблице | признаки…; целевое значение | CSV |
| Картинки для LoRA | фото + подпись в .txt | папка |
| Распознавание объектов | фото + координаты рамок | YOLO / COCO |
Пять шагов к рабочему датасету
Определите «идеальный ответ»
Какой ответ вы бы одобрили как эталон? Без этого критерия разметка расползается.
Соберите сырьё
Переписки, письма, тикеты, документы. Чем ближе к реальным запросам, тем полезнее.
Разметьте
Для пар — выберите или перепишите ответы до эталона. Для классов — единый словарь меток без синонимов.
Вычистите
Дубли, противоречия, персональные данные, обрывки. Проверьте баланс классов: 95 % одного ответа — модель научится только ему.
Разделите
80–90 % на обучение, остальное — проверка, которую модель не видит.
Ошибки, которые встречаются чаще всего
Дубли
Один пример в десяти копиях — модель заучивает его наизусть.
Дисбаланс
Редкий класс из трёх примеров модель игнорирует.
Противоречия
На одинаковый вопрос два разных ответа — модель выбирает случайно.
Личные данные
Телефоны и имена внутри датасета — утечка и нарушение закона.
Синтетика без проверки
Сгенерированные примеры повторяют одни и те же обороты — модель беднеет.
Нет проверочной части
Точность 99 % на обучении и провал в работе.
Главное — коротко
Слово «обучить» в запросе почти всегда значит «сделать так, чтобы нейросеть работала под меня». В трёх случаях из четырёх это решается без обучения: инструкцией с примерами или базой знаний по вашим файлам. Дообучение и своя модель — когда первые два способа честно попробованы и не хватило.
Собрать датасет из моих данных
Приложите выгрузку — агент приведёт к формату, вычистит, разметит по вашему эталону и отдаст файл с описанием.
Поставить задачу →Частые вопросы
Сколько примеров нужно?
Для стиля — 50–100, для предметной области — сотни, для классификации — от 100–200 на класс, для таблицы — сотни строк.
Можно ли сгенерировать датасет нейросетью?
Частично: расширить свои примеры вариациями. Полностью синтетический датасет учит модель повторять другую модель, а не вас.
Что такое JSONL?
Текстовый файл, где каждая строка — отдельный JSON-объект с одним примером. Так его читают все инструменты дообучения.