Агент отличается от чат-бота тем, что действует: открывает системы, заполняет поля, принимает решения и ошибается в реальном процессе. Обучать и проверять его на диалогах бесполезно — нужны записанные траектории действий, сценарии-среды, где агент можно прогнать повторяемо, и разметка того, где именно он свернул не туда. Мы собираем такие данные под конкретный процесс заказчика: экспертами, знающими предметную область, под NDA и на инфраструктуре в РФ.

Агенту нужны не пары «вопрос — ответ», а последовательности: что он увидел, что решил, что сделал и чем это кончилось. Мы готовим четыре типа данных — записанные траектории действий эксперта, сценарии-среды для повторяемых прогонов, разметку ошибочных шагов и приёмочные наборы, на которых агент проверяется перед выпуском в рабочий процесс.
Эксперт проходит процесс сам, а мы записываем каждый шаг: что открыл, что ввёл, почему выбрал этот вариант.
Воспроизводимая копия процесса, где агента можно прогнать сто раз подряд и сравнить результаты между версиями.
В неудачной траектории отмечается конкретный шаг, где решение свернуло не туда, а не просто факт провала.
Набор задач с заранее известным правильным исходом — на нём агент проверяется перед выпуском в работу.
Проверка, тот ли инструмент выбран, верны ли аргументы и корректно ли обработан ответ системы.
Случаи, где агент обязан остановиться и передать человеку: нехватка прав, спорные данные, цена ошибки.
Начинаем с процесса, а не с модели: разбираем, какой именно сценарий агент должен вести и где ошибка стоит дорого. На пилоте записываем первые траектории и собираем маленькую среду, чтобы проверить, воспроизводится ли задача вообще. Затем масштабируем сбор силами экспертов, размечаем ошибочные шаги и передаём приёмочный набор вместе с отчётом о согласованности оценок.
Траектории отдаём построчно в JSONL: шаг, состояние, вызванный инструмент, аргументы, ответ системы и пометка эксперта. Сценарии-среды передаём как воспроизводимую конфигурацию с фиксированными входными данными, чтобы прогон повторялся один в один. Приёмочные наборы — отдельным файлом с ожидаемым исходом по каждой задаче, пригодным для автоматического прогона в вашем пайплайне.
Главный риск здесь не опечатка в разметке, а красивая траектория, которая не воспроизводится. Поэтому качество проверяем прогоном: записанный сценарий запускается повторно и должен дать тот же исход. Дополнительно сверяем согласованность между экспертами на спорных шагах и отдельно проверяем, что приёмочный набор не пересекается с обучающими траекториями.
Сценарий прогоняется повторно: если исход поплыл, среда описана недостаточно и дорабатывается.
Спорные шаги размечают независимо несколько человек, расхождения разбираются и уточняют инструкцию.
Приёмочные задачи не пересекаются с обучающими траекториями — иначе проверка меряет память, а не умение.
Каждый шаг несёт состояние и причину выбора: без причины траектория не учит, а только показывает результат.
Отдельно проверяем случаи, где агент обязан остановиться, а не довести действие до конца.
Сбор, хранение и разметка — на инфраструктуре в России, доступ по NDA и журналируется.
Считаем по часам экспертной работы — от 320 ₽ за час. Стоимость зависит от длины сценария, требуемой квалификации эксперта и от того, нужна ли воспроизводимая среда или достаточно записанных траекторий. Среда дороже: её приходится описывать так, чтобы прогон повторялся. Калькулятор ниже даёт ориентир, точную смету называем после разбора процесса.
Тем, кто уже пробовал поставить агента в рабочий процесс и упёрся в то, что на демо он работает, а на реальных данных ломается непредсказуемо. Чаще всего это финансы и ритейл, где процесс формализован, повторяется тысячи раз в день и цена ошибки считается в деньгах, а не в неудобстве.
Эксперты прошли процесс обработки заявки вручную, фиксируя каждый шаг и причину выбора; на неудачных прогонах отмечался конкретный шаг расхождения. Отдельно собрали приёмочный набор задач с известным исходом, не пересекающийся с обучающими траекториями. Показатели — типовой сценарий проекта такого класса, не кейс конкретного клиента.
Диалог — это пара «вопрос — ответ», и он учит модель говорить. Траектория — последовательность действий: что агент увидел, какой инструмент вызвал, с какими аргументами, что вернула система и почему следующий шаг был выбран именно такой. Обучать агента на диалогах можно, но проверить, что он корректно ведёт процесс, — нельзя: в диалоге нет ни состояния, ни последствий.
Траектории показывают, как процесс проходил один раз. Среда позволяет прогнать агента заново — сто раз, на тех же входных данных, после каждой правки модели. Без этого нельзя сказать, стала новая версия лучше или просто иначе ошиблась. Среда дороже в подготовке, поэтому на пилоте мы сначала проверяем, воспроизводится ли задача вообще.
Данные и разработку удобнее вести параллельно. Пока команда собирает агента, эксперты уже записывают траектории и приёмочный набор — к моменту, когда появится первая рабочая версия, есть на чём её проверять. Если агента разрабатываем мы, эти работы идут одним проектом: см. страницу разработки ИИ-агентов.
Заказчику. Записанные траектории, конфигурации сред, приёмочные наборы и разметка ошибочных шагов передаются полностью, условия фиксируются в договоре до старта работ. Мы не переиспользуем собранные материалы в других проектах и не включаем их в собственные наборы данных.
Зависит от того, насколько формализован процесс. Для узкого сценария с малым числом ветвлений первые полезные результаты видны на десятках траекторий; для процесса с множеством исключений счёт идёт на сотни. Точную цифру называть заранее нечестно — на пилоте мы записываем первую партию и смотрим, как быстро перестают появляться новые ветки.
Потому что направление уже стало основным на мировом рынке обучающих данных, а в российском сегменте его не продаёт никто. Мы предпочитаем занять тему заранее и говорить о ней прямо, а не делать вид, что спрос уже есть. Если ваша задача сегодня решается обычной разметкой — мы так и скажем.
Опишите процесс, который должен вести агент, и где ошибка стоит дороже всего — вернёмся с планом пилота и оценкой в течение 1 рабочего дня.
Не любите формы — напишите на info@datamarkup.ru