Блог DataMarkup: подготовка данных, ML и ИИ на практике

Разбираем разметку и подготовку данных для машинного обучения простым языком: термины, виды разметки по типам данных, контроль качества, форматы и инструменты — с примерами и ссылками на реальные услуги.

Что вы найдёте в блоге DataMarkup?

Блог DataMarkup — образовательный хаб о разметке и подготовке данных для машинного обучения и ИИ: разбираем термины простым языком, показываем виды разметки по типам данных, объясняем, как устроен процесс и контроль качества, и связываем теорию с практикой через ссылки на реальные услуги и кейсы.

Материалы охватывают весь путь работы с обучающими данными для машинного обучения: базовые понятия — что такое разметка данных, чем размеченные данные отличаются от неразмеченных, как соотносятся термины «разметка» и «аннотация». Дальше — виды разметки по типам данных: bounding box и сегментация для изображений и видео, транскрибация и диаризация для аудио и речи, NER и классификация текста для NLP-задач, 3D bounding box и облака точек для LiDAR-сцен, разметка патологий на медицинских снимках DICOM. Отдельный блок статей посвящён смежным темам — готовым датасетам, сбору данных для обучения моделей, классическим понятиям машинного обучения (обучение с учителем, обучающая и тестовая выборка) и разметке данных для больших языковых моделей: SFT, RLHF, оценка качества ответов LLM.

Блог будет полезен, если вы готовите обучающую выборку самостоятельно и хотите разобраться в терминологии, метриках качества и форматах выгрузки, выбираете подрядчика по разметке и сверяете подходы и определения, или изучаете машинное обучение и ищете понятные объяснения без лишней теории и пересказа чужих статей. Мы стараемся отвечать на реальные вопросы: чем один термин отличается от другого, какие форматы использовать под конкретную модель, как проверить качество готовой выборки прежде, чем запускать обучение. Каждая статья построена вокруг вопросов, на которые ищут ответ на практике, — с прямым ответом в первом абзаце и подборкой частых вопросов внизу.

Из любой статьи можно перейти в блок «Смотрите также» — там ссылки на соседние материалы блога и на профильную услугу DataMarkup, если задачу разметки удобнее и быстрее решить руками экспертной команды с контролем качества, а не только прочитать о ней. Ниже — весь список опубликованных статей блога, он пополняется по мере выхода новых материалов, от базовых терминов до специализированных вертикалей вроде LiDAR, DICOM и разметки данных для больших языковых моделей.

Все статьи блога

Обложка статьи: Что такое компьютерное зрение простыми словами

Что такое компьютерное зрение простыми словами

Компьютерное зрение — это технология, которая распознаёт объекты на фото и видео. Как она устроена, зачем нужна бизнесу, примеры применения.

Обложка статьи: Нейросеть для юристов: что умеет и где ошибается

Нейросеть для юристов: что умеет и где ошибается

Нейросеть для юристов: что умеет — анализ договоров, поиск практики, документы. Где ошибается и как проверять её ответ по праву.

Обложка статьи: Аугментация данных: как расширить выборку без новой съёмки

Аугментация данных: как расширить выборку без новой съёмки

Аугментация данных простыми словами: как искусственно расширить обучающую выборку, какие методы применяют для картинок, текста и звука, где она вредит.

Обложка статьи: Где взять датасет: обзор источников данных

Где взять датасет: обзор источников данных

Где найти и скачать датасет для обучения модели: мировые площадки, российские открытые данные, отраслевые репозитории. На что смотреть в лицензии.

Обложка статьи: Как создать ИИ-агента: пошаговый разбор

Как создать ИИ-агента: пошаговый разбор

Как создать ИИ-агента: выбор задачи, база знаний, инструменты, инструкции и проверка качества. Что делать самому, что готовить заранее и где обычно ломается.

Обложка статьи: Распознавание первичных документов: как это работает

Распознавание первичных документов: как это работает

Как работает распознавание первичных документов: счета, накладные, акты, УПД. Почему падает точность, как её измеряют и какие данные нужны для обучения модели.

Обложка статьи: Что такое ИИ-агент и как он работает

Что такое ИИ-агент и как он работает

ИИ-агент простыми словами: как он работает, чем отличается от чат-бота и ассистента, из каких частей состоит и какие данные нужны, чтобы он отвечал точно.

Обложка статьи: Speech to text: как машина превращает речь в текст

Speech to text: как машина превращает речь в текст

Speech to text (STT) — технология перевода речи в текст: как устроен ASR, из чего складывается точность, какие модели используют и где проходят границы.

Обложка статьи: Датасеты для машинного обучения: подборка по категориям

Датасеты для машинного обучения: подборка по категориям

Подборка известных датасетов для машинного обучения по категориям: CV, NLP, аудио, таблицы. Международные и русскоязычные наборы, как выбрать и лицензии.

Обложка статьи: Аннотация данных: определение, термины, типы

Аннотация данных: определение, термины, типы

Аннотация данных — что это такое, чем термин отличается от разметки данных и какие типы аннотации бывают: от bounding box до аннотации текста и метаданных.

Обложка статьи: Аутсорсинг разметки данных против своей команды: что выбрать

Аутсорсинг разметки данных против своей команды: что выбрать

Сравниваем аутсорсинг разметки данных и найм своей команды по стоимости, скорости, качеству, масштабированию и рискам. Таблица и гибридная модель.

Обложка статьи: Автоматическая разметка данных: авторазметка и pre-labeling

Автоматическая разметка данных: авторазметка и pre-labeling

Что такое авторазметка данных, как работает pre-labeling foundation-моделями, когда достаточно авто, а когда нужен человек — гибридный подход 2026.

Обложка статьи: Bounding box vs сегментация vs полигоны

Bounding box vs сегментация vs полигоны

Bounding box vs сегментация vs полигоны: сравнение точности, скорости разметки и стоимости. Таблица различий и как выбрать вид разметки под задачу.

Обложка статьи: Что такое CVAT и для чего нужен этот инструмент разметки

Что такое CVAT и для чего нужен этот инструмент разметки

CVAT — что это за инструмент разметки данных: возможности, типы разметки, открытая и облачная версия cvat.ai, кому подходит и какие у него ограничения.

Обложка статьи: Что такое датасет простыми словами

Что такое датасет простыми словами

Датасет — это структурированный набор данных для обучения и проверки моделей. Разбираем структуру, train/test/validation и где взять датасет.

Обложка статьи: Что такое DICOM

Что такое DICOM

DICOM — стандартный формат хранения медицинских снимков: из чего состоит файл, чем отличается от NIfTI, зачем данные размечают и деперсонализируют для ИИ.

Обложка статьи: Что такое LiDAR

Что такое LiDAR

LiDAR — лазерный дальномер, который строит облако точек: как устроен принцип работы, из чего состоит облако точек и где данные LiDAR применяют в ИИ.

Обложка статьи: Что такое OCR

Что такое OCR

OCR — технология распознавания текста на изображениях: как устроен процесс, чем классический OCR отличается от нейросетевого и от чего зависит точность.

Обложка статьи: Разметка данных: что это такое, виды и примеры

Разметка данных: что это такое, виды и примеры

Разметка данных — что это простыми словами: определение, виды по типам данных, примеры и как устроен процесс. Разбираем качество и что влияет на цену.

Обложка статьи: CVAT vs Label Studio: сравнение инструментов разметки данных

CVAT vs Label Studio: сравнение инструментов разметки данных

CVAT vs Label Studio: сравниваем философию, типы данных, автоматизацию, форматы экспорта, деплой и лицензии. Таблица различий, Supervisely как альтернатива.

Обложка статьи: Какие данные нужны для обучения большой языковой модели

Какие данные нужны для обучения большой языковой модели

Какие данные нужны для обучения языковой модели на каждом этапе — от предобучения до RLHF. Таблица этапов, роль качества данных и экспертов.

Обложка статьи: Детекция объектов: object detection в компьютерном зрении

Детекция объектов: object detection в компьютерном зрении

Детекция объектов — что это, anchor-based и anchor-free подходы, архитектуры YOLO, Faster R-CNN, DETR в таблице, метрики mAP и IoU, данные для обучения модели.

Обложка статьи: Что такое диаризация спикеров

Что такое диаризация спикеров

Диаризация — разделение аудиозаписи на реплики по говорящим. Разбираем, как она работает, зачем нужна распознаванию речи и как измеряют точность метрикой DER.

Обложка статьи: Что такое fine-tuning (дообучение) LLM

Что такое fine-tuning (дообучение) LLM

Fine-tuning LLM простыми словами: full fine-tuning vs LoRA и PEFT, когда дообучение нужно, какие данные готовят и какие ошибки допускают чаще всего.

Обложка статьи: Форматы разметки COCO, YOLO и Pascal VOC

Форматы разметки COCO, YOLO и Pascal VOC

Форматы разметки данных COCO, YOLO и Pascal VOC: что внутри JSON, txt и XML, сравнительная таблица, конвертация между форматами и как выбрать нужный.

Обложка статьи: Генерация синтетических данных

Генерация синтетических данных

Как генерируют синтетические данные: генеративные модели, 3D-рендеринг, аугментация, табличные генераторы. Разбираем пайплайн генерации и валидацию результата.

Обложка статьи: Топ инструментов разметки данных: обзор по категориям

Топ инструментов разметки данных: обзор по категориям

Обзор инструментов разметки данных по категориям: open-source (CVAT, Label Studio, VIA), облачные (Supervisely, SuperAnnotate, Roboflow) и специализированные.

Обложка статьи: Качественные данные: по каким критериям их оценивают

Качественные данные: по каким критериям их оценивают

Качественные данные — это данные, полные, точные, консистентные, репрезентативные и актуальные. Разбираем каждый критерий и чек-лист оценки датасета.

Обложка статьи: Качество разметки данных: как его измерить и проверить

Качество разметки данных: как его измерить и проверить

Как измерить качество разметки данных: accuracy, precision/recall, IAA и коэффициент каппа. Чек-лист для проверки подрядчика и разбор типовых ошибок.

Обложка статьи: Как нейросеть обучается: от весов до готовой модели

Как нейросеть обучается: от весов до готовой модели

Как обучается нейросеть простыми словами: прямой проход, ошибка, обратное распространение, эпохи и батчи. Разбираем шаг за шагом, что происходит внутри сети.

Обложка статьи: Как размечать данные: пошаговый процесс от гайдлайна до выгрузки

Как размечать данные: пошаговый процесс от гайдлайна до выгрузки

Как размечать данные для машинного обучения: гайдлайн, пилот, основной этап и контроль качества, выгрузка. Инструменты и типичные ошибки новичков.

Обложка статьи: Как размечать данные в CVAT: пошаговая инструкция

Как размечать данные в CVAT: пошаговая инструкция

Как размечать в CVAT пошагово: создание проекта и задачи, загрузка данных, bounding box и полигоны, интерполяция видео, экспорт разметки, типичные ошибки.

Обложка статьи: Как собрать датасет для нейросети пошагово

Как собрать датасет для нейросети пошагово

Пошаговая инструкция, как собрать и создать датасет для нейросети: цель, сбор данных, чистка, разметка, валидация, форматы. Частые ошибки новичков.

Обложка статьи: Как выбрать подрядчика для разметки данных: чек-лист

Как выбрать подрядчика для разметки данных: чек-лист

Чек-лист критериев выбора подрядчика по разметке данных: качество и SLA, NDA и 152-ФЗ, прозрачность цены, пилот, инструменты. Красные флаги и вопросы для брифа.

Обложка статьи: Разметка ключевых точек (keypoints)

Разметка ключевых точек (keypoints)

Разметка ключевых точек (keypoints): что это, задачи — поза человека, лицевые точки, руки, формат COCO keypoints и метрика OKS для оценки точности.

Обложка статьи: Классификация изображений в машинном обучении

Классификация изображений в машинном обучении

Классификация изображений — определение, таблица сравнения с детекцией и сегментацией, архитектуры CNN и ViT, требования к данным и разметке.

Обложка статьи: Обзор компаний по разметке данных в России

Обзор компаний по разметке данных в России

Нейтральный обзор 9 компаний по разметке данных в России: специализация, публичные цифры, открытость цены и пилот. Таблица сравнения и советы по выбору.

Обложка статьи: Лидар и радар: в чём разница

Лидар и радар: в чём разница

Лидар и радар в чём разница: принцип работы, дальность, погода, разрешение и цена. Сравнительная таблица + что выбирают беспилотные автомобили.

Обложка статьи: Методы классификации данных: какой алгоритм выбрать

Методы классификации данных: какой алгоритм выбрать

Методы классификации данных: логистическая регрессия, деревья решений, случайный лес, SVM и нейросети. Таблица сильных и слабых сторон, как выбрать метод.

Обложка статьи: Метрики качества модели: accuracy, precision, recall и другие

Метрики качества модели: accuracy, precision, recall и другие

Глоссарий метрик качества модели: accuracy, precision, recall, F1, mAP, IoU и Dice — простыми словами и на примерах. Confusion matrix и какую метрику выбрать.

Обложка статьи: NER: как модель находит имена, даты и организации в тексте

NER: как модель находит имена, даты и организации в тексте

NER (Named Entity Recognition) — что это, какие типы сущностей выделяет, как работает, где применяется. BIO-разметка и метрики precision/recall для NER.

Обложка статьи: Обработка естественного языка: что такое NLP и как он работает

Обработка естественного языка: что такое NLP и как он работает

NLP — что это и какие задачи решает: классификация, NER, тональность, суммаризация, перевод, QA. Как устроен современный NLP и в чём специфика русского языка.

Обложка статьи: Обучающая, валидационная и тестовая выборка в машинном обучении

Обучающая, валидационная и тестовая выборка в машинном обучении

Зачем данные делят на обучающую, валидационную и тестовую выборки, какие пропорции использовать, что такое утечка данных и когда нужна кросс-валидация.

Обложка статьи: Обучение с учителем в машинном обучении: как это устроено

Обучение с учителем в машинном обучении: как это устроено

Обучение с учителем — что это простыми словами: как устроен процесс, чем отличается от обучения без учителя и с подкреплением, и какие задачи решает.

Обложка статьи: Как оценивают качество и тестируют LLM

Как оценивают качество и тестируют LLM

Как оценивают и тестируют LLM: бенчмарки, human eval, LLM-as-judge, red teaming, метрики качества и роль человеческой разметки в оценке.

Обложка статьи: Оцифровка документов

Оцифровка документов

Оцифровка документов — не просто скан. Разбираем этапы процесса, какие документы оцифровывают и зачем нужна верификация человеком после OCR.

Обложка статьи: Переобучение модели: признаки, причины и способы борьбы

Переобучение модели: признаки, причины и способы борьбы

Переобучение (overfitting) — что это, как распознать по кривым обучения, какие причины его вызывают и как с ним бороться: регуляризация, дропаут, аугментация.

Обложка статьи: Что такое RAG в языковых моделях

Что такое RAG в языковых моделях

RAG (Retrieval-Augmented Generation) простыми словами: как устроен поиск и генерация ответа, чем RAG отличается от fine-tuning и в чём ограничения.

Обложка статьи: Распознавание рукописного текста

Распознавание рукописного текста

Распознавание рукописного текста сложнее печатного: разбираем, что такое HTR, чем оно отличается от OCR, как обучают модели и в чём специфика русской рукописи.

Обложка статьи: Как расшифровать аудио в текст: инструменты и качество

Как расшифровать аудио в текст: инструменты и качество

Как расшифровать аудио в текст: пошаговая инструкция, инструменты автоматического распознавания речи и ручной транскрибации, проверка качества по WER.

Обложка статьи: Размеченные данные: что это такое и зачем они нужны модели

Размеченные данные: что это такое и зачем они нужны модели

Размеченные данные это данные с метками, которые понимает модель: классы, границы, транскрипт. Сравниваем с неразмеченными и примеры по типам данных.

Обложка статьи: Разметка LiDAR и облаков точек

Разметка LiDAR и облаков точек

Как устроена разметка LiDAR и облаков точек: кубоиды, сегментация, трекинг в 3D. Чем сложнее разметки изображений, какие инструменты и метрики качества.

Обложка статьи: Разметка медицинских снимков для ИИ

Разметка медицинских снимков для ИИ

Зачем медицинскому ИИ размеченные КТ, МРТ и рентген, кто размечает снимки, что такое консенсус врачей и метрика Dice, как это регулирует 152-ФЗ.

Обложка статьи: Разметка речи: диаризация, таймстемпы и речевые датасеты

Разметка речи: диаризация, таймстемпы и речевые датасеты

Зачем ASR и TTS нужна размеченная речь: диаризация спикеров, таймстемпы, эмоции и как устроен сбор качественных речевых датасетов для обучения моделей.

Обложка статьи: Как размечают тексты для обучения языковых моделей

Как размечают тексты для обучения языковых моделей

Разметка текста для LLM: чем отличается от NLP-разметки, какие задачи входят — SFT-пары, ранжирование ответов, рубрики, safety — и как проверяют качество.

Обложка статьи: Что такое RLHF в обучении языковых моделей

Что такое RLHF в обучении языковых моделей

RLHF — метод обучения языковых моделей на обратной связи людей. Разбираем, как устроен процесс SFT-RM-RLHF, зачем нужны парные сравнения ответов.

Обложка статьи: Российские и русскоязычные датасеты для ИИ

Российские и русскоязычные датасеты для ИИ

Подборка российских и русскоязычных датасетов: речь, тексты NLP, где искать открытые наборы и на что смотреть в лицензии. Импортозамещение в данных для ИИ.

Обложка статьи: Сегментация изображений: виды, применение, метрики

Сегментация изображений: виды, применение, метрики

Сегментация изображений: семантическая, instance и panoptic (таблица), где применяется, как размечают маски, метрики IoU и Dice.

Обложка статьи: Синтетические данные простыми словами

Синтетические данные простыми словами

Синтетические данные — искусственно сгенерированные данные для ИИ. Разбираем, зачем они нужны, чем отличаются от реальных и какие риски domain gap несут.

Обложка статьи: Сколько стоит разметка данных в 2026 году

Сколько стоит разметка данных в 2026 году

Сколько стоит разметка данных: реальные вилки цен по изображениям, видео, аудио, тексту, LiDAR и DICOM. От чего зависит цена и как сэкономить на разметке.

Обложка статьи: Стемминг и лемматизация: как привести слово к базовой форме

Стемминг и лемматизация: как привести слово к базовой форме

Стемминг и лемматизация текста — что это, чем отличаются, когда что использовать. Таблица с примерами русских слов и роль в предобработке для NLP.

Обложка статьи: Тональность текста: как устроен sentiment analysis

Тональность текста: как устроен sentiment analysis

Анализ тональности (sentiment analysis): уровни документ/аспект, где применяют, как размечают шкалы и сарказм, какими метриками измеряют качество разметки.

Обложка статьи: Транскрибация: что это такое и как она устроена

Транскрибация: что это такое и как она устроена

Транскрибация — перевод устной речи в текст: ручная расшифровка и автоматическое распознавание (ASR), точность WER и как выбрать способ для своей задачи.

Обложка статьи: Трекинг объектов на видео: object tracking

Трекинг объектов на видео: object tracking

Трекинг объектов на видео — что это, чем отличается от детекции, алгоритмы SORT, DeepSORT, ByteTrack, метрики MOTA и IDF1, данные для разметки трекинга.

Обложка статьи: Виды разметки данных

Виды разметки данных

Какие виды разметки данных существуют: bounding box, сегментация, keypoints, NER, транскрибация, 3D-кубоиды. Таблица — как выбрать вид под задачу.

Частые вопросы о блоге DataMarkup

О чём блог DataMarkup?

Это образовательный хаб о разметке и подготовке данных для машинного обучения и ИИ: что такое разметка данных и аннотация, какие виды разметки бывают по типам данных (изображения, видео, аудио, текст, LiDAR, DICOM), как устроен процесс и контроль качества, что такое датасеты и как данные связаны с обучением LLM.

Кому будут полезны статьи блога?

ML-инженерам и дата-сайентистам, которые готовят обучающие выборки, продакт- и проджект-менеджерам, выбирающим подрядчика по разметке, студентам и всем, кто разбирается в машинном обучении и хочет понять, как данные становятся пригодными для обучения модели.

Как часто выходят новые статьи?

Блог пополняется регулярно: мы закрываем весь пилларный план — от базовых терминов и видов разметки до ML-теории, компьютерного зрения, NLP, аудио, LiDAR, датасетов и разметки данных для больших языковых моделей (LLM, RLHF, RAG).

Как перейти от статьи блога к заказу разметки данных?

В каждой статье есть блок «Смотрите также» со ссылками на релевантную услугу и соседние материалы. Если нужен точный расчёт — загляните на страницу цен с калькулятором или оставьте заявку на бесплатный пилот на тестовой партии данных.

Нужна разметка данных под вашу задачу?

Опишите тип данных и цель — вернёмся с гайдлайном, сроком и сметой в течение рабочего дня. Первую тестовую партию размечаем бесплатно.

Не любите формы — напишите на info@datamarkup.ru

Куда двигаться дальше

Telegramответим за 15 минут