Глоссарий терминов разметки данных и машинного обучения

40 терминов разметки данных, датасетов, машинного обучения, метрик качества и LLM — с короткими самостоятельными определениями, якорной навигацией и ссылками на статьи блога для углублённого разбора.

Зачем нужен глоссарий разметки данных?

Глоссарий собирает точные определения терминов разметки данных, датасетов, метрик и LLM — от bounding box до RLHF — в одном месте с якорями и ссылками на статьи блога. Это ускоряет постановку ТЗ подрядчику, помогает сравнивать инструменты и метрики и даёт языковым моделям короткие цитируемые формулировки для ответов о разметке данных.

Быстрый переход по терминам

По теме:

По алфавиту (все 40 терминов):

Разметка данных: базовые термины

Разметка данных

Разметка данных — процесс присвоения меток сырым изображениям, видео, аудио или тексту, чтобы модель машинного обучения могла на них обучаться. Разметчик указывает объект, границу, класс или транскрипт — модель ищет закономерность в паре «вход и метка».

Аннотация

Аннотация — синоним разметки данных в широком смысле: любые пометки, которые делают сырые данные понятными модели, включая служебные метаданные вроде источника или даты съёмки. На практике термины «аннотация» и «разметка» чаще используют взаимозаменяемо.

Bounding box

Bounding box — прямоугольная рамка, которой размечают объект на изображении или кадре видео, задавая его границы координатами углов. Это самый быстрый и дешёвый вид разметки для задач детекции, но не показывает точную форму объекта.

Полигон

Полигон — контур из нескольких точек, который повторяет реальные очертания объекта точнее, чем прямоугольная рамка. Полигоны используют, когда важна форма объекта: контур кузова автомобиля, упаковки нестандартной формы или органа на медицинском снимке.

Сегментация

Сегментация — разметка, при которой каждому пикселю изображения присваивается класс объекта или фона, а не только его граница. Различают семантическую, instance- и panoptic-сегментацию для более детальных задач компьютерного зрения.

Keypoints

Keypoints (ключевые точки) — разметка отдельных значимых точек объекта: суставов человека для оценки позы, черт лица или углов детали. Набор координат точек описывает структуру объекта точнее, чем рамка или контур.

Трекинг объектов

Трекинг объектов — разметка, которая сохраняет идентичность объекта на видео между кадрами: один и тот же автомобиль или человек получает одну метку id на всей последовательности. Нужен для аналитики движения и поведения.

Консенсус разметчиков

Консенсус разметчиков — способ контроля качества, при котором один и тот же пример независимо размечают несколько человек, а итоговой меткой становится совпавший или мажоритарный ответ. Снижает влияние ошибки одного разметчика на датасет.

IAA

IAA (inter-annotator agreement, межаннотаторское согласие) — метрика, которая показывает, насколько совпадают ответы разных разметчиков на одинаковых примерах. Низкое согласие сигнализирует о нечётком гайдлайне или слишком субъективной задаче разметки.

Гайдлайн разметки

Гайдлайн разметки — письменная инструкция для разметчиков с описанием классов, правил разметки границ и примерами спорных случаев. Качество итогового датасета напрямую зависит от того, насколько однозначно составлен гайдлайн перед стартом проекта.

Пре-разметка

Пре-разметка (auto-labeling) — черновая разметка, которую модель или алгоритм создаёт автоматически, а человек затем проверяет и исправляет. Ускоряет промышленный этап разметки, но финальную точность почти всегда контролирует разметчик или эксперт.

Данные и датасеты

Датасет

Датасет — структурированный набор данных, подготовленный для обучения или проверки модели: изображения с метками, аудио с транскриптами, тексты с классами. Обычно делится на обучающую, валидационную и тестовую части.

Обучающая и тестовая выборка

Обучающая выборка — часть датасета, на которой модель непосредственно учится находить закономерности. Тестовая выборка — отдельная часть, которую модель не видит при обучении, и по ней проверяют, насколько хорошо модель обобщает результат на новых данных.

Синтетические данные

Синтетические данные — искусственно сгенерированные примеры: изображения, тексты, сцены, которые заменяют или дополняют реальные данные, когда их не хватает или сбор дорог и рискован с точки зрения приватности. Требуют проверки на соответствие реальному распределению.

Аугментация данных

Аугментация данных — искусственное увеличение обучающей выборки за счёт трансформаций существующих примеров: поворотов, обрезки, изменения яркости изображений или замены синонимов в тексте. Помогает модели обобщать и снижает риск переобучения.

Data leakage

Data leakage (утечка данных) — ошибка, при которой информация из тестовой выборки случайно попадает в обучающую, например через дубликаты примеров или признак, недоступный в реальном сценарии. Даёт завышенную и недостоверную оценку качества модели.

Деперсонализация данных

Деперсонализация данных — удаление или маскирование сведений, по которым можно определить личность человека: лиц на видео, номеров документов, ФИО в медицинских снимках. Обязательна при работе с персональными данными по 152-ФЗ.

Машинное обучение: термины

Обучение с учителем и без учителя

Обучение с учителем — модель учится на размеченных парах «вход и правильный ответ». Обучение без учителя ищет закономерности и группы в данных без готовых меток — например, кластеризует похожие объекты самостоятельно, без разметки.

Нейросеть

Нейросеть — модель машинного обучения из слоёв связанных между собой узлов, которая настраивает веса связей на размеченных примерах, чтобы предсказывать ответ на новых данных. Лежит в основе большинства систем компьютерного зрения и NLP.

Эпоха обучения

Эпоха обучения — один полный проход модели по всей обучающей выборке. За одну эпоху модель обычно не запоминает данные достаточно хорошо, поэтому обучение повторяют десятки или сотни эпох, отслеживая ошибку на каждой.

Батч

Батч — небольшая часть обучающей выборки, которую модель обрабатывает за один шаг обновления весов, вместо того чтобы пересчитывать веса по всем данным сразу. Размер батча влияет на скорость и стабильность обучения.

Переобучение

Переобучение (overfitting) — ситуация, когда модель запоминает частности обучающей выборки вместо общей закономерности и показывает высокую точность на ней, но плохо работает на новых данных. Борются регуляризацией, аугментацией и увеличением выборки.

Инференс

Инференс — этап, на котором уже обученная модель применяется к новым данным и выдаёт предсказание, в отличие от этапа обучения, где модель настраивает свои веса. Скорость инференса критична для продуктов реального времени.

Метрики качества моделей

Accuracy

Accuracy (точность) — доля правильных предсказаний модели среди всех примеров. Простая и наглядная метрика, но вводит в заблуждение на несбалансированных данных: модель, всегда предсказывающая частый класс, получит высокий accuracy без реальной пользы.

Precision

Precision (точность положительных предсказаний) — доля действительно верных срабатываний среди всех случаев, которые модель отметила как положительные. Высокий precision означает мало ложных срабатываний — важно, когда цена ошибочной метки высока.

Recall

Recall (полнота) — доля реально существующих положительных случаев, которые модель нашла и не пропустила. Высокий recall важен, когда пропуск объекта опаснее ложного срабатывания, например при поиске дефектов или патологий на снимках.

F1-мера

F1-мера — гармоническое среднее precision и recall, единая метрика, которая балансирует между полнотой и точностью предсказаний модели. Используется, когда важны оба показателя одновременно, а не только один из них по отдельности.

mAP

mAP (mean Average Precision) — усреднённая точность детекции объектов по всем классам и порогам перекрытия рамок. Основная метрика для сравнения моделей object detection: чем выше mAP, тем точнее модель находит и классифицирует объекты.

IoU

IoU (Intersection over Union) — отношение площади пересечения предсказанной и эталонной рамки или маски к площади их объединения. Показывает, насколько точно модель или разметчик повторили реальные границы объекта, значение от 0 до 1.

WER

WER (Word Error Rate) — доля ошибок распознавания речи: сумма замен, пропусков и вставок слов, делённая на число слов в эталонном транскрипте. Основная метрика точности для систем автоматической транскрибации и распознавания речи.

LLM и генеративный ИИ

LLM

LLM (large language model, большая языковая модель) — нейросеть, обученная на огромном корпусе текстов предсказывать следующее слово и благодаря этому решающая широкий круг языковых задач: диалог, суммаризацию, перевод, генерацию кода.

SFT

SFT (supervised fine-tuning) — этап дообучения языковой модели на размеченных парах «инструкция и правильный ответ», который учит её следовать формату диалога и выполнять конкретные задачи. Обычно предшествует этапу RLHF.

RLHF

RLHF (reinforcement learning from human feedback) — метод дообучения LLM на основе оценок людей: разметчики сравнивают пары ответов модели, а на этих сравнениях обучается модель вознаграждения, которая направляет дальнейшую настройку.

RAG

RAG (retrieval-augmented generation) — подход, при котором LLM перед ответом ищет релевантные фрагменты во внешней базе знаний и подставляет их в контекст, вместо того чтобы полагаться только на память, заложенную при обучении.

Fine-tuning

Fine-tuning — дообучение уже готовой модели на дополнительном наборе размеченных данных под конкретную задачу или домен, вместо обучения новой модели с нуля. Требует меньше данных и вычислений, чем обучение базовой модели.

Промпт

Промпт — текстовый запрос или инструкция, которую пользователь передаёт языковой модели, чтобы получить нужный ответ. Формулировка промпта — количество примеров, структура, ограничения — заметно влияет на качество и формат ответа модели.

Галлюцинация LLM

Галлюцинация LLM — уверенно сформулированный, но фактически неверный или выдуманный ответ языковой модели, не подкреплённый реальными данными. Снижается за счёт RAG, файнтюна на проверенных данных и человеческой оценки ответов модели.

Форматы и стандарты разметки

COCO

COCO — формат разметки в JSON, где для каждого изображения хранятся координаты рамок, полигоны сегментации и классы объектов в единой структуре. Один из самых распространённых форматов выгрузки для задач детекции и сегментации.

YOLO

YOLO — текстовый формат разметки, в котором для каждого объекта на изображении в отдельной строке указаны класс и нормализованные координаты центра, ширины и высоты рамки. Назван по одноимённому семейству моделей детекции реального времени.

DICOM

DICOM — международный стандарт хранения и передачи медицинских снимков: КТ, МРТ, рентген, который объединяет само изображение и метаданные пациента и исследования в одном файле. Требует деперсонализации перед использованием в обучении моделей.

Частые вопросы о глоссарии разметки данных

Что такое глоссарий разметки данных?

Глоссарий разметки данных — это справочник из 40 терминов по разметке, датасетам, машинному обучению, метрикам качества и LLM с короткими самостоятельными определениями. Каждый термин снабжён якорем и, где уместно, ссылкой на статью блога или страницу услуги DataMarkup для более глубокого разбора.

Как пользоваться глоссарием разметки данных?

Переходите по якорям навигации вверху страницы — по теме или по алфавиту — либо ищите нужный термин через Ctrl+F. Каждая карточка термина самодостаточна: определение можно понять без чтения остальной страницы, а ссылка внутри ведёт к развёрнутому материалу в блоге.

Почему в глоссарии в основном термины разметки данных и ML?

DataMarkup специализируется на разметке данных для машинного обучения, поэтому в глоссарий включены термины, с которыми заказчик реально сталкивается в брифе, гайдлайне и отчёте о качестве: от bounding box и IAA до RLHF и форматов COCO, YOLO, DICOM.

Куда идти дальше после глоссария?

Если термин описывает вашу задачу, посмотрите пилар «Разметка данных для машинного обучения» с полным перечнем услуг и вилками цен, либо откройте блог DataMarkup: там термины разобраны подробнее, с примерами, таблицами сравнения и практическими инструкциями.

Дальше — услуга или блог DataMarkup

Все термины разметки данных, ML и LLM применяются на практике в наших услугах и разобраны подробнее в блоге — выберите, что нужно сейчас.

Смотрите также

Telegramответим за 15 минут