Проекты внедрения ИИ чаще всего останавливаются не на выборе модели, а на данных: их либо нет в нужном виде, либо они не размечены, либо качество никто не измерял. Мы ведём проект от аудита данных до работающего сервиса: собираем и размечаем выборку, обучаем модель, разрабатываем решение и интегрируем его в ваш контур. Можно начать с одного этапа — например, с аудита данных.

Типичная картина: компания выбрала задачу и подрядчика, но обучать модель не на чем. Исторические данные лежат в разных системах, не размечены, содержат дубли и ошибки, а требования к качеству никто не формулировал. В результате сроки сдвигаются на этапе, который в плане проекта занимал одну строку.
Архив есть, но пригодных для обучения примеров в нём в разы меньше ожидаемого.
Сырые фото, записи и документы без аннотаций модель обучать не позволяют.
Редкие, но важные случаи почти не представлены — модель их не распознаёт.
Данные собраны разными способами и в разном качестве, единого формата нет.
Нет контрольной выборки и метрик, по которым можно понять, стало ли лучше.
Персональные данные и съёмка людей требуют согласий и корректного хранения.
Сначала мы разбираем задачу и смотрим, какие данные уже есть и насколько они пригодны. Затем формируем план: что доразметить, что дособрать, какую часть отложить в контрольную выборку. Дальше идёт пилотная партия, согласование инструкции и промышленный объём с приёмкой по метрикам.
Отдаём данные в формате, который принимает ваш пайплайн: COCO, YOLO, Pascal VOC, JSONL или выгрузку в вашей структуре. К каждой партии прикладываем инструкцию разметки, отчёт по метрикам качества и описание содержимого — включая распределение классов и перечень спорных случаев.
Целевая accuracy фиксируется в договоре как измеримая величина, а не как обещание. Каждую партию проверяет отдельный QA-контур: перекрёстная разметка спорных случаев, расчёт согласованности между разметчиками и выборочный аудит. Партия, не прошедшая порог, переразмечается за наш счёт.
Целевой порог точности закрепляется договором и проверяется на приёмке каждого этапа.
Спорные объекты размечают несколько специалистов, итог берётся по согласию.
Считаем IAA — насколько разметчики совпадают между собой на одной выборке.
QA-инженер независимо проверяет случайную долю партии перед сдачей.
Вы получаете фактические цифры качества, а не устное подтверждение.
Не прошедшая порог партия исправляется без дополнительной оплаты.
Стоимость зависит от типа данных и объёма: разметка изображений считается за партию объектов, аудио и видео — за минуту, экспертные задачи — по часам от 320 ₽. Открытые вилки по всем типам собраны на странице цен, а точную смету фиксируем после бесплатного пилота на вашей выборке.
Первым проектом обычно берут узкую задачу с понятной экономикой и уже накопленными данными: контроль качества продукции по фотографиям, распознавание документов, аналитика обращений клиентов. Такой пилот проверяет гипотезу за недели, а не за год, и показывает реальное состояние данных компании.
Провели аудит архива из 40 000 фотографий с линии: пригодными для обучения оказались 12 000, редкий тип дефекта был представлен 30 кадрами. Дособрали недостающие примеры и разметили выборку за 4 недели, accuracy разметки на приёмке — 99,2%. Показатели — типовой сценарий проекта такого класса, не кейс конкретного клиента.
Да, ведём проект целиком: аудит и подготовка данных, обучение модели, разработка сервиса и интеграция с вашими системами. Если часть работ уже закрыта вашей командой, подключаемся только на нужном этапе — чаще всего это данные и оценка качества модели.
С узкой задачи, где есть накопленные данные и понятна цена ошибки: контроль качества по фото, распознавание документов, разбор обращений. Следующий шаг — аудит данных: он показывает, хватает ли материала для обучения и что придётся дособрать.
Зависит от задачи: для простой классификации может хватить нескольких тысяч примеров на класс, для детекции в сложных условиях требуется значительно больше. Точный ответ даёт аудит: важен не только объём, но и покрытие редких случаев.
Есть три пути: дособрать данные в реальных условиях, использовать готовые датасеты как основу и сгенерировать синтетические примеры для редких случаев. Обычно комбинируют все три — синтетика хорошо закрывает ситуации, которые сложно снять вживую.
Пилотная партия занимает от нескольких дней, промышленный объём — от нескольких недель в зависимости от объёма и сложности. Точный срок называем после пилота, когда известна фактическая скорость разметки на ваших данных.
Заказчику. Размеченные данные, инструкция разметки и отчёты по качеству передаются вам и используются вами без ограничений. Условия передачи прав фиксируются в договоре до старта работ.
Опишите задачу и пришлите пример данных — вернёмся с оценкой пригодности выборки и планом подготовки в течение 1 рабочего дня.
Не любите формы — напишите на info@datamarkup.ru