Каталог готовых датасетов для обучения и тестирования моделей: лица и биометрия, товары и полки, транспорт и дорожные сцены, русская речь, документы. Датасет для обучения ИИ подбирается под задачу и формат вашей модели, каждый набор идёт с понятной лицензией и тестовым сэмплом до оплаты; нужной категории нет в каталоге — соберём и разметим данные под ваше ТЗ. Купить датасет для нейросети можно поштучно, без подписки и минимального пакета: подготовка датасетов для машинного обучения ведётся под конкретную задачу, а не выдаётся из общего маркетплейса датасетов.
Купить готовый размеченный датасет можно вместо разметки данных с нуля: это уже собранный и размеченный набор — лица, товары, дорожные сцены, речь или документы, — готовый к обучению модели сразу после оплаты. В отличие от разметки на заказ, где мы работаем с вашими сырыми данными, здесь исходные данные и разметку готовим сами, а вы получаете тестовый сэмпл ещё до покупки.
Такой формат ускоряет пилот и бенчмаркинг модели: не нужно самостоятельно собирать и размечать базовый набор, чтобы проверить гипотезу или сравнить архитектуры. Датасет можно докупить, расширить новой партией или доразметить под изменившееся ТЗ.
Каталог закрывает восемь направлений: лица и биометрия, товары и полки, транспорт и дорожные сцены, русская речь, документы для OCR, дефекты продукции, медицинские снимки и агро. Но универсального набора под конкретную задачу почти никогда не существует, поэтому большинство проектов идёт вторым путём — мы собираем датасет под ваши условия съёмки и ваш перечень классов.
Фото и видео лиц с согласиями субъектов и соблюдением 152-ФЗ: ракурсы, освещение, демография.
Товары, полки и ценники из реальных магазинов с разметкой для распознавания SKU.
Автомобили, номера и дорожные сцены с разметкой для детекции и распознавания.
Дикторы разных регионов, диалекты и шумовые условия для ASR и TTS.
Счета, анкеты, рукописный текст и синтетические макеты документов с разметкой полей.
Сколы, трещины, брак сборки и покрытия: съёмка на вашей линии и разметка с ОТК.
КТ, МРТ, рентген и гистология: обезличивание DICOM и разметка врачами.
Болезни растений по фото, сорняки, всходы и съёмка полей с дрона.
Каски, жилеты и страховочные привязи, вход в опасную зону, дым и открытый огонь.
Интенты, сущности и эталонные ответы из обезличенной переписки и тикетов.
Демонстрации операций, синхронные потоки с датчиков, точки захвата и корпус неудачных попыток.
Стандартный комплект включает исходные файлы (изображения, видео, аудио или документы), разметку в согласованном формате, документ лицензии с условиями использования и сопроводительное описание — состав классов, объём партии, метаданные съёмки или записи. Для датасетов с людьми дополнительно прикладываем подтверждение согласий субъектов на обработку данных.
Исходные изображения, видео, аудио или сканы документов в оригинальном разрешении.
Аннотации в согласованном формате: COCO, YOLO, CVAT XML, JSON или под ваш пайплайн.
Документ с условиями использования: обучение, коммерческое применение, срок и территория.
Минимальная партия в финальном формате — проверяете качество до оплаты основного объёма.
Датасет нужен везде, где модель должна принимать решение по изображению, звуку или тексту: от контроля брака на линии до разбора обращений клиентов. Список задач исчисляется сотнями, и почти под каждую готового набора не существует — данные приходится собирать под конкретное производство, культуру, оборудование или клиентскую базу.
Дефекты продукции, сварные швы, коррозия, комплектность сборки, контроль упаковки и маркировки.
Товары на полке, ценники, выкладка, инвентаризация, распознавание чеков и накладных.
СИЗ и каски, вход в опасные зоны, огонь и дым, оставленные предметы, подсчёт людей.
Номера, дорожные знаки, состояние покрытия, загрузка транспорта, поведение водителя.
КТ, МРТ, рентген, УЗИ, гистология, снимки глазного дна, протоколы исследований.
Болезни растений, сорняки, всходы, съёмка полей с дрона, подсчёт плодов и скота.
Первичка и счета, анкеты, паспорта, транзакции с признаками мошенничества, скоринг.
Записи звонков, голосовые команды, диалоги поддержки, дикторская речь для синтеза.
Отзывы и тональность, темы обращений, извлечение сущностей, база знаний для ассистента.
Не нашли свою задачу в списке — это нормально: их гораздо больше девяти. Опишите, что должна распознавать или предсказывать модель, и мы скажем, какие данные для этого нужны, сколько их потребуется и как их собрать.
Каталог покрывает частые запросы, но многие проекты требуют индивидуальной задачи — свой набор классов, локацию съёмки или редкий домен. В этом случае мы собираем данные под заказ: краудсорсинг, скрапинг или синтетика, — а затем размечаем их по вашему техзаданию и передаём вместе с готовым датасетом.
Например, если нужны лица только определённой возрастной группы, документы конкретного региона или редкие дорожные сцены — такие наборы собираем с нуля силами команды сбора данных, а не донабираем из существующего каталога. Срок и объём пилотной партии согласуем на брифе.
Каждый датасет передаётся по лицензии, которая фиксирует разрешённые способы использования — обучение модели, коммерческое применение, ограничение по числу проектов или бессрочное право. Для датасетов с людьми (лица, голос) отдельно подтверждаем согласия субъектов на обработку персональных данных и соответствие 152-ФЗ.
Условия конкретной лицензии — срок, территория использования, право на передачу третьим лицам — фиксируем в договоре до оплаты, а не постфактум. Для датасета лиц и биометрии согласия субъектов на съёмку и обработку данных входят в комплект поставки вместе с самим набором.
Каждый датасет передаётся по лицензии, которая фиксирует разрешённые способы использования: обучение модели, коммерческое применение, ограничение по числу проектов или бессрочное право. Для датасетов с людьми — лица, голос — отдельно подтверждаем согласия субъектов на обработку персональных данных и соответствие 152-ФЗ. Условия закрепляем в договоре до оплаты.
Формат согласуем под ваш пайплайн: COCO, YOLO, Pascal VOC, CVAT XML, JSON, WAV/MP3 с транскриптами или CSV с метаданными — в зависимости от категории датасета. Стандартный набор форматов для каждой категории (лица, товары, транспорт, речь, документы) указан на странице конкретного каталога.
Да, по договорённости можем поставлять регулярные обновления или новые партии — например, добавлять свежие сцены, дикторов или документы, если ваша модель дообучается на новых данных. Условия и периодичность обновлений фиксируем отдельно при оформлении заказа.
Да, базовый каталог можно дополнить под конкретную задачу: другой набор классов, локация съёмки, язык или демография. Для узкоспециализированных требований, которые сильно отличаются от каталога, обычно выгоднее собрать данные под заказ — опишите задачу, и мы предложим оптимальный вариант.
Ориентир — от 15 000 ₽ за партию: готовый пакет одной категории с лицензией и тестовым сэмплом. Точная цена зависит от категории, объёма данных и условий лицензии; для нестандартных наборов и кастомного сбора расчёт всегда индивидуальный. Смету и сэмпл присылаем в течение одного рабочего дня после запроса.
Укажите категорию — лица, товары, транспорт, речь или документы — и нужный объём. Пришлём сэмпл, условия лицензии и смету в течение 1 рабочего дня.
Не любите формы — напишите на info@datamarkup.ru
Краудсорсинг, скрапинг и синтетика, если готового датасета в каталоге нет
Разметим ваши собственные сырые данные под любую ML-задачу
Подборка открытых и коммерческих датасетов по категориям
Обзор отечественных источников данных для обучения моделей
Гайды, разборы форматов и практик контроля качества