Данные и среды для обучения ИИ-агентов

Агент отличается от чат-бота тем, что действует: открывает системы, заполняет поля, принимает решения и ошибается в реальном процессе. Обучать и проверять его на диалогах бесполезно — нужны записанные траектории действий, сценарии-среды, где агент можно прогнать повторяемо, и разметка того, где именно он свернул не туда. Мы собираем такие данные под конкретный процесс заказчика: экспертами, знающими предметную область, под NDA и на инфраструктуре в РФ.

Траектории реальных действийСценарии-среды для повторных прогоновЭксперты предметной областиNDA на каждый проектДанные в РФ · 152-ФЗ
Два монитора на рабочем столе: слева размечен шаг сценария и заполняемая форма, справа журнал выполненных шагов

Какие данные нужны, чтобы обучить и проверить ИИ-агента?

Агенту нужны не пары «вопрос — ответ», а последовательности: что он увидел, что решил, что сделал и чем это кончилось. Мы готовим четыре типа данных — записанные траектории действий эксперта, сценарии-среды для повторяемых прогонов, разметку ошибочных шагов и приёмочные наборы, на которых агент проверяется перед выпуском в рабочий процесс.

Траектории действий

Эксперт проходит процесс сам, а мы записываем каждый шаг: что открыл, что ввёл, почему выбрал этот вариант.

Сценарии-среды

Воспроизводимая копия процесса, где агента можно прогнать сто раз подряд и сравнить результаты между версиями.

Разметка ошибочных шагов

В неудачной траектории отмечается конкретный шаг, где решение свернуло не туда, а не просто факт провала.

Приёмочные наборы

Набор задач с заранее известным правильным исходом — на нём агент проверяется перед выпуском в работу.

Разметка вызовов инструментов

Проверка, тот ли инструмент выбран, верны ли аргументы и корректно ли обработан ответ системы.

Границы и отказы

Случаи, где агент обязан остановиться и передать человеку: нехватка прав, спорные данные, цена ошибки.

Как проходит проект по данным для агента?

Начинаем с процесса, а не с модели: разбираем, какой именно сценарий агент должен вести и где ошибка стоит дорого. На пилоте записываем первые траектории и собираем маленькую среду, чтобы проверить, воспроизводится ли задача вообще. Затем масштабируем сбор силами экспертов, размечаем ошибочные шаги и передаём приёмочный набор вместе с отчётом о согласованности оценок.

Разбор процессаСмотрим, какой сценарий ведёт агент, какие системы затрагивает и где цена ошибки максимальна.
Пилот на одном сценарииЗаписываем первые траектории и собираем минимальную среду, чтобы проверить воспроизводимость задачи.
Сбор траекторийЭксперты проходят процесс, каждый шаг фиксируется вместе с причиной выбора, а не только с результатом.
Разметка ошибокВ неудачных прогонах отмечаем конкретный шаг расхождения и его тип — неверный инструмент, данные или решение.
Приёмочный наборСобираем задачи с известным исходом и фиксируем, какой результат считается прохождением.

В каких форматах отдаются данные для агентов?

Траектории отдаём построчно в JSONL: шаг, состояние, вызванный инструмент, аргументы, ответ системы и пометка эксперта. Сценарии-среды передаём как воспроизводимую конфигурацию с фиксированными входными данными, чтобы прогон повторялся один в один. Приёмочные наборы — отдельным файлом с ожидаемым исходом по каждой задаче, пригодным для автоматического прогона в вашем пайплайне.

JSONL с траекториямиКонфигурация средыПриёмочный наборОтчёт о согласованности
Label StudioArgillaСобственная платформаAPI-интеграция

Как проверяется качество данных для агента?

Главный риск здесь не опечатка в разметке, а красивая траектория, которая не воспроизводится. Поэтому качество проверяем прогоном: записанный сценарий запускается повторно и должен дать тот же исход. Дополнительно сверяем согласованность между экспертами на спорных шагах и отдельно проверяем, что приёмочный набор не пересекается с обучающими траекториями.

Проверка воспроизводимостью

Сценарий прогоняется повторно: если исход поплыл, среда описана недостаточно и дорабатывается.

Согласованность экспертов

Спорные шаги размечают независимо несколько человек, расхождения разбираются и уточняют инструкцию.

Разделение выборок

Приёмочные задачи не пересекаются с обучающими траекториями — иначе проверка меряет память, а не умение.

Полнота шага

Каждый шаг несёт состояние и причину выбора: без причины траектория не учит, а только показывает результат.

Проверка отказов

Отдельно проверяем случаи, где агент обязан остановиться, а не довести действие до конца.

Данные в РФ

Сбор, хранение и разметка — на инфраструктуре в России, доступ по NDA и журналируется.

Сколько стоят данные для обучения ИИ-агента?

Считаем по часам экспертной работы — от 320 ₽ за час. Стоимость зависит от длины сценария, требуемой квалификации эксперта и от того, нужна ли воспроизводимая среда или достаточно записанных траекторий. Среда дороже: её приходится описывать так, чтобы прогон повторялся. Калькулятор ниже даёт ориентир, точную смету называем после разбора процесса.

от 320 ₽ / час экспертной работы
Ориентировочно: Не оферта. Точная смета — после пилота.

Кому нужны данные для обучения агентов?

Тем, кто уже пробовал поставить агента в рабочий процесс и упёрся в то, что на демо он работает, а на реальных данных ломается непредсказуемо. Чаще всего это финансы и ритейл, где процесс формализован, повторяется тысячи раз в день и цена ошибки считается в деньгах, а не в неудобстве.

Пример проекта

Траектории и приёмочный набор для агента обработки заявок

Эксперты прошли процесс обработки заявки вручную, фиксируя каждый шаг и причину выбора; на неудачных прогонах отмечался конкретный шаг расхождения. Отдельно собрали приёмочный набор задач с известным исходом, не пересекающийся с обучающими траекториями. Показатели — типовой сценарий проекта такого класса, не кейс конкретного клиента.

Ключевые факты

Данные для агентов — самое частое направление мирового рынка обучающих данных: его предлагают 19 из 28 проверенных международных платформ, чаще, чем классическую разметку изображений.
Обзор 28 мировых платформ, анализ DataMarkup · 2026
В российском сегменте направление как отдельная услуга не встретилось ни у одной из 78 проверенных компаний — спроса в поиске пока нет, страница сделана на опережение.
Замер 78 компаний, анализ DataMarkup · 2026
Собранные траектории и среды обрабатываются и хранятся на инфраструктуре в РФ по 152-ФЗ, доступ выдаётся по NDA.
Политика обработки данных DataMarkup · 2026

Частые вопросы о данных для ИИ-агентов

Чем траектории отличаются от обычных диалоговых данных?

Диалог — это пара «вопрос — ответ», и он учит модель говорить. Траектория — последовательность действий: что агент увидел, какой инструмент вызвал, с какими аргументами, что вернула система и почему следующий шаг был выбран именно такой. Обучать агента на диалогах можно, но проверить, что он корректно ведёт процесс, — нельзя: в диалоге нет ни состояния, ни последствий.

Зачем нужна воспроизводимая среда, если есть записанные траектории?

Траектории показывают, как процесс проходил один раз. Среда позволяет прогнать агента заново — сто раз, на тех же входных данных, после каждой правки модели. Без этого нельзя сказать, стала новая версия лучше или просто иначе ошиблась. Среда дороже в подготовке, поэтому на пилоте мы сначала проверяем, воспроизводится ли задача вообще.

У нас нет своего агента, только идея. Данные всё равно нужны?

Данные и разработку удобнее вести параллельно. Пока команда собирает агента, эксперты уже записывают траектории и приёмочный набор — к моменту, когда появится первая рабочая версия, есть на чём её проверять. Если агента разрабатываем мы, эти работы идут одним проектом: см. страницу разработки ИИ-агентов.

Кому принадлежат собранные траектории и среды?

Заказчику. Записанные траектории, конфигурации сред, приёмочные наборы и разметка ошибочных шагов передаются полностью, условия фиксируются в договоре до старта работ. Мы не переиспользуем собранные материалы в других проектах и не включаем их в собственные наборы данных.

Сколько траекторий нужно, чтобы это имело смысл?

Зависит от того, насколько формализован процесс. Для узкого сценария с малым числом ветвлений первые полезные результаты видны на десятках траекторий; для процесса с множеством исключений счёт идёт на сотни. Точную цифру называть заранее нечестно — на пилоте мы записываем первую партию и смотрим, как быстро перестают появляться новые ветки.

Почему вы делаете эту страницу, если спроса в поиске нет?

Потому что направление уже стало основным на мировом рынке обучающих данных, а в российском сегменте его не продаёт никто. Мы предпочитаем занять тему заранее и говорить о ней прямо, а не делать вид, что спрос уже есть. Если ваша задача сегодня решается обычной разметкой — мы так и скажем.

Обсудим данные для вашего агента

Опишите процесс, который должен вести агент, и где ошибка стоит дороже всего — вернёмся с планом пилота и оценкой в течение 1 рабочего дня.

Не любите формы — напишите на info@datamarkup.ru

Смотрите также

Telegramответим за 15 минут