Как мы сравнивали компании по разметке данных?
Мы сравнивали компании по четырём проверяемым публично критериям: заявленная специализация и типы данных, публичные цифры о компании (годы на рынке, число клиентов или исполнителей), доступность цены на сайте без запроса коммерческого предложения и наличие бесплатного пилотного проекта перед основным заказом. Источник фактов — только официальные сайты компаний.
Такой подход не заменяет полноценную проверку подрядчика перед реальным заказом, но даёт стартовую точку сравнения по одинаковым для всех критериям, без оценочных суждений вроде «лучше» или «хуже» — каждая компания описана тем, что она сама сообщает о себе публично. В список включены как крупные managed-подрядчики с собственной штатной командой, так и краудсорсинговые платформы и узкоспециализированные команды — рынок разметки данных в России достаточно разнородный, и формат работы стоит учитывать наравне со специализацией.
Какие компании занимаются разметкой данных в России?
На российском рынке разметки данных работают компании разного профиля: managed-подрядчики с собственной штатной командой разметчиков, краудсорсинговые платформы с широким пулом внешних исполнителей и нишевые команды, специализирующиеся на одном типе данных или одной индустрии. Ниже — карточки по каждой из девяти компаний обзора, включая нашу собственную.
Data Light
Data Light — managed-подрядчик по разметке изображений, видео, DICOM- и NIfTI-снимков, а также модерации контента; часть задач компания закрывает через краудсорсинг. На сайте указаны более 200 клиентов в России и СНГ и команда свыше 1000 исполнителей. Отдельно заметен образовательный блог компании — подробные материалы о терминах и методах машинного обучения и компьютерного зрения, от обучения с учителем до трекинга объектов, который может быть полезен заказчику ещё на этапе знакомства с темой.
TrainingData.ru
TrainingData.ru работает как маркетплейс готовых и заказных датасетов: биометрия, медицина, логистика и умные города — направления, указанные на сайте компании. Публично отмечен опыт команды в разработке CVAT, одного из самых распространённых open-source инструментов разметки в мире. Помимо продажи датасетов, компания ведёт образовательный блог с материалами о методах классификации данных и семантической сегментации, ориентированный на разработчиков и ML-инженеров.
Beorg
Beorg — российская платформа разметки данных, резидент «Сколково», совмещающая режим самообслуживания и managed-услуги с freemium-стартом. Специализация — разметка изображений, текста и документов, заявленная на сайте производительность — обработка более 100 000 изображений и документов в сутки. Отдельное направление — оцифровка и распознавание документов (OCR): на сайте компании есть подробные объяснения самой технологии OCR и практические материалы по переводу бумажных архивов в электронный вид.
Annotate.ru
Annotate.ru занимается аннотированием датасетов для нейросетей и AI-продуктов «любой сложности и объёма», как указано в описании услуг на сайте компании. Ресурс ведёт образовательный раздел о базовых терминах разметки — что такое разметка данных, чем размеченные данные отличаются от сырых, как устроено создание датасета и авторазметка. Для заказчиков, которые только погружаются в тему, такой блок объяснений может быть удобной точкой входа перед выбором подрядчика и формулировкой технического задания.
LabelMe
LabelMe специализируется на разметке изображений, текста и аудио и готовит датасеты под конкретную ML-задачу заказчика. На сайте компания указывает, что работает с 2019 года, подписывает NDA и предлагает бесплатный тестовый датасет для оценки качества перед основным заказом — то есть пилотный этап встроен в саму модель работы с клиентом, а не оформляется как отдельная договорённость по запросу.
NeuroCore (AI Lab)
NeuroCore позиционирует себя как AI-лаборатория полного цикла — от сбора данных до готового датасета для ML-продукта. Специализация охватывает изображения, текст, аудио и медицинские снимки: на сайте заявлен опыт работы с более чем 500 000 изображений МРТ, а также датасеты автомобильных номеров для задач автоматического распознавания (ANPR) и OCR. Такой профиль подходит заказчикам, которым важно закрыть несколько типов данных у одного подрядчика без разделения проекта между разными командами.
Яндекс Краудсорсинг
Яндекс Краудсорсинг — краудсорсинговая платформа для сбора и разметки данных; в описании услуги упоминаются разметка видео научных экспериментов и данные для автономного транспорта. На сайте платформы заявлена точность разметки 95–99%. Формат краудсорсинга подразумевает распределение задач между большим пулом исполнителей через интерфейс самообслуживания, что заметно отличает этот вариант от managed-подрядчиков с выделенной под проект штатной командой и персональным сопровождением.
US-DATA
US-DATA — команда, специализирующаяся на аннотации данных для компьютерного зрения и NLP: bounding box, сегментация, полигоны и классификация изображений и видео, а также NER и анализ тональности текста. Результат выдаётся в стандартных форматах COCO, YOLO и CVAT, что упрощает интеграцию разметки в уже существующий пайплайн обучения модели без дополнительной конвертации на стороне заказчика.
DataMarkup
DataMarkup — это мы, и мы указываем это прямо: раз уж делаем обзор рынка, честно включаем в него и себя, по тем же критериям, что и остальных. Специализация — разметка изображений, видео, аудио, текста, LiDAR/3D-данных и медицинских снимков DICOM, а также сбор данных и модерация контента. Мы публикуем цены и калькулятор на странице /pricing/ и предлагаем бесплатный пилот перед основным заказом — как новая на рынке команда, мы стараемся компенсировать отсутствие многолетней истории открытостью условий и понятным SLA по точности.
Как компании сравниваются по специализации, цене и пилоту?
Таблица ниже сводит специализацию, открытость цены на сайте и наличие пилотного проекта по всем девяти компаниям обзора в одном месте. Она не ранжирует компании между собой, а помогает быстрее сузить список кандидатов под конкретную задачу — например, отдельно отметить тех, кто прямо на сайте предлагает тестовый проект перед стартом.
| Компания | Специализация | Цена на сайте | Пилот |
|---|---|---|---|
| Data Light | Изображения, видео, DICOM/NIfTI, модерация, краудсорсинг | По запросу | Уточняется на сайте |
| TrainingData.ru | Готовые и заказные датасеты (биометрия, медицина, логистика) | По запросу | Уточняется на сайте |
| Beorg | Изображения, текст, документы, OCR | По запросу | Уточняется на сайте |
| Annotate.ru | Аннотирование датасетов любой сложности | По запросу | Уточняется на сайте |
| LabelMe | Изображения, текст, аудио, датасеты под задачу | По запросу | Да, тестовый датасет |
| NeuroCore | Изображения, текст, аудио, медснимки, ANPR/OCR-датасеты | По запросу | Уточняется на сайте |
| Яндекс Краудсорсинг | Краудсорсинговый сбор и разметка данных | По запросу | Уточняется на сайте |
| US-DATA | CV-аннотация (bbox, сегментация), NLP (NER, тональность) | Частично | Уточняется на сайте |
| DataMarkup | Изображения, видео, аудио, текст, LiDAR/3D, DICOM | Да, /pricing/ | Да |
Колонки «Цена на сайте» и «Пилот» отражают только то, что видно на сайте компании на момент подготовки обзора; конкретные условия стоит уточнять напрямую у подрядчика, так как страницы и предложения обновляются.
Как выбрать компанию для разметки данных под свою задачу?
Выбор стоит начинать с типа данных и объёма проекта: узкоспециализированная компания часто глубже разбирается в своей вертикали, а более широкий подрядчик удобнее, если проект сочетает несколько типов данных сразу. Дальше имеет смысл сверить прозрачность цены, наличие NDA и готовность дать бесплатный пилот — это самые быстрые проверяемые сигналы перед стартом переговоров.
Если данные чувствительные — персональные, медицинские или связанные с коммерческой тайной, — отдельно стоит уточнить, где физически хранятся данные и подписывает ли подрядчик NDA до передачи первой тестовой партии. Для проектов с растущим объёмом полезно заранее спросить, как команда масштабируется: набирает ли дополнительных разметчиков под пик нагрузки или работает фиксированным составом.
Формат работы тоже стоит учитывать отдельно: managed-подрядчик с выделенной командой обычно удобнее для проектов со сложным гайдлайном и высокими требованиями к точности, а краудсорсинговая платформа может быть быстрее и гибче на простых массовых задачах, где легко разделить объём между множеством исполнителей. Разница особенно заметна на пилотном этапе — по тому, кто именно и как отвечает на уточняющие вопросы по разметке.
Финальную проверку разумно делать не по описанию на сайте, а на пилотной партии данных из своего же проекта: там сразу видно и качество, и скорость, и то, насколько удобно устроена коммуникация с командой подрядчика на практике. Более подробный чек-лист критериев и вопросов для брифинга — в отдельном материале о выборе подрядчика для разметки данных.
