40 терминов разметки данных, датасетов, машинного обучения, метрик качества и LLM — с короткими самостоятельными определениями, якорной навигацией и ссылками на статьи блога для углублённого разбора.
Глоссарий собирает точные определения терминов разметки данных, датасетов, метрик и LLM — от bounding box до RLHF — в одном месте с якорями и ссылками на статьи блога. Это ускоряет постановку ТЗ подрядчику, помогает сравнивать инструменты и метрики и даёт языковым моделям короткие цитируемые формулировки для ответов о разметке данных.
По теме:
По алфавиту (все 40 терминов):
Разметка данных — процесс присвоения меток сырым изображениям, видео, аудио или тексту, чтобы модель машинного обучения могла на них обучаться. Разметчик указывает объект, границу, класс или транскрипт — модель ищет закономерность в паре «вход и метка».
Подробнее о разметке данных · Услуга: разметка данных под ключ
Аннотация — синоним разметки данных в широком смысле: любые пометки, которые делают сырые данные понятными модели, включая служебные метаданные вроде источника или даты съёмки. На практике термины «аннотация» и «разметка» чаще используют взаимозаменяемо.
Bounding box — прямоугольная рамка, которой размечают объект на изображении или кадре видео, задавая его границы координатами углов. Это самый быстрый и дешёвый вид разметки для задач детекции, но не показывает точную форму объекта.
Полигон — контур из нескольких точек, который повторяет реальные очертания объекта точнее, чем прямоугольная рамка. Полигоны используют, когда важна форма объекта: контур кузова автомобиля, упаковки нестандартной формы или органа на медицинском снимке.
Сегментация — разметка, при которой каждому пикселю изображения присваивается класс объекта или фона, а не только его граница. Различают семантическую, instance- и panoptic-сегментацию для более детальных задач компьютерного зрения.
Keypoints (ключевые точки) — разметка отдельных значимых точек объекта: суставов человека для оценки позы, черт лица или углов детали. Набор координат точек описывает структуру объекта точнее, чем рамка или контур.
Трекинг объектов — разметка, которая сохраняет идентичность объекта на видео между кадрами: один и тот же автомобиль или человек получает одну метку id на всей последовательности. Нужен для аналитики движения и поведения.
Консенсус разметчиков — способ контроля качества, при котором один и тот же пример независимо размечают несколько человек, а итоговой меткой становится совпавший или мажоритарный ответ. Снижает влияние ошибки одного разметчика на датасет.
IAA (inter-annotator agreement, межаннотаторское согласие) — метрика, которая показывает, насколько совпадают ответы разных разметчиков на одинаковых примерах. Низкое согласие сигнализирует о нечётком гайдлайне или слишком субъективной задаче разметки.
Гайдлайн разметки — письменная инструкция для разметчиков с описанием классов, правил разметки границ и примерами спорных случаев. Качество итогового датасета напрямую зависит от того, насколько однозначно составлен гайдлайн перед стартом проекта.
Пре-разметка (auto-labeling) — черновая разметка, которую модель или алгоритм создаёт автоматически, а человек затем проверяет и исправляет. Ускоряет промышленный этап разметки, но финальную точность почти всегда контролирует разметчик или эксперт.
Датасет — структурированный набор данных, подготовленный для обучения или проверки модели: изображения с метками, аудио с транскриптами, тексты с классами. Обычно делится на обучающую, валидационную и тестовую части.
Обучающая выборка — часть датасета, на которой модель непосредственно учится находить закономерности. Тестовая выборка — отдельная часть, которую модель не видит при обучении, и по ней проверяют, насколько хорошо модель обобщает результат на новых данных.
Синтетические данные — искусственно сгенерированные примеры: изображения, тексты, сцены, которые заменяют или дополняют реальные данные, когда их не хватает или сбор дорог и рискован с точки зрения приватности. Требуют проверки на соответствие реальному распределению.
Зачем нужны синтетические данные · Услуга: синтетические данные
Аугментация данных — искусственное увеличение обучающей выборки за счёт трансформаций существующих примеров: поворотов, обрезки, изменения яркости изображений или замены синонимов в тексте. Помогает модели обобщать и снижает риск переобучения.
Data leakage (утечка данных) — ошибка, при которой информация из тестовой выборки случайно попадает в обучающую, например через дубликаты примеров или признак, недоступный в реальном сценарии. Даёт завышенную и недостоверную оценку качества модели.
Деперсонализация данных — удаление или маскирование сведений, по которым можно определить личность человека: лиц на видео, номеров документов, ФИО в медицинских снимках. Обязательна при работе с персональными данными по 152-ФЗ.
Деперсонализация и 152-ФЗ на практике · Услуга: разметка медицинских данных
Обучение с учителем — модель учится на размеченных парах «вход и правильный ответ». Обучение без учителя ищет закономерности и группы в данных без готовых меток — например, кластеризует похожие объекты самостоятельно, без разметки.
Нейросеть — модель машинного обучения из слоёв связанных между собой узлов, которая настраивает веса связей на размеченных примерах, чтобы предсказывать ответ на новых данных. Лежит в основе большинства систем компьютерного зрения и NLP.
Эпоха обучения — один полный проход модели по всей обучающей выборке. За одну эпоху модель обычно не запоминает данные достаточно хорошо, поэтому обучение повторяют десятки или сотни эпох, отслеживая ошибку на каждой.
Батч — небольшая часть обучающей выборки, которую модель обрабатывает за один шаг обновления весов, вместо того чтобы пересчитывать веса по всем данным сразу. Размер батча влияет на скорость и стабильность обучения.
Переобучение (overfitting) — ситуация, когда модель запоминает частности обучающей выборки вместо общей закономерности и показывает высокую точность на ней, но плохо работает на новых данных. Борются регуляризацией, аугментацией и увеличением выборки.
Инференс — этап, на котором уже обученная модель применяется к новым данным и выдаёт предсказание, в отличие от этапа обучения, где модель настраивает свои веса. Скорость инференса критична для продуктов реального времени.
Accuracy (точность) — доля правильных предсказаний модели среди всех примеров. Простая и наглядная метрика, но вводит в заблуждение на несбалансированных данных: модель, всегда предсказывающая частый класс, получит высокий accuracy без реальной пользы.
Precision (точность положительных предсказаний) — доля действительно верных срабатываний среди всех случаев, которые модель отметила как положительные. Высокий precision означает мало ложных срабатываний — важно, когда цена ошибочной метки высока.
Recall (полнота) — доля реально существующих положительных случаев, которые модель нашла и не пропустила. Высокий recall важен, когда пропуск объекта опаснее ложного срабатывания, например при поиске дефектов или патологий на снимках.
F1-мера — гармоническое среднее precision и recall, единая метрика, которая балансирует между полнотой и точностью предсказаний модели. Используется, когда важны оба показателя одновременно, а не только один из них по отдельности.
mAP (mean Average Precision) — усреднённая точность детекции объектов по всем классам и порогам перекрытия рамок. Основная метрика для сравнения моделей object detection: чем выше mAP, тем точнее модель находит и классифицирует объекты.
IoU (Intersection over Union) — отношение площади пересечения предсказанной и эталонной рамки или маски к площади их объединения. Показывает, насколько точно модель или разметчик повторили реальные границы объекта, значение от 0 до 1.
WER (Word Error Rate) — доля ошибок распознавания речи: сумма замен, пропусков и вставок слов, делённая на число слов в эталонном транскрипте. Основная метрика точности для систем автоматической транскрибации и распознавания речи.
LLM (large language model, большая языковая модель) — нейросеть, обученная на огромном корпусе текстов предсказывать следующее слово и благодаря этому решающая широкий круг языковых задач: диалог, суммаризацию, перевод, генерацию кода.
Какие данные нужны для обучения LLM · Услуга: данные для LLM
SFT (supervised fine-tuning) — этап дообучения языковой модели на размеченных парах «инструкция и правильный ответ», который учит её следовать формату диалога и выполнять конкретные задачи. Обычно предшествует этапу RLHF.
RLHF (reinforcement learning from human feedback) — метод дообучения LLM на основе оценок людей: разметчики сравнивают пары ответов модели, а на этих сравнениях обучается модель вознаграждения, которая направляет дальнейшую настройку.
RAG (retrieval-augmented generation) — подход, при котором LLM перед ответом ищет релевантные фрагменты во внешней базе знаний и подставляет их в контекст, вместо того чтобы полагаться только на память, заложенную при обучении.
Fine-tuning — дообучение уже готовой модели на дополнительном наборе размеченных данных под конкретную задачу или домен, вместо обучения новой модели с нуля. Требует меньше данных и вычислений, чем обучение базовой модели.
Промпт — текстовый запрос или инструкция, которую пользователь передаёт языковой модели, чтобы получить нужный ответ. Формулировка промпта — количество примеров, структура, ограничения — заметно влияет на качество и формат ответа модели.
Галлюцинация LLM — уверенно сформулированный, но фактически неверный или выдуманный ответ языковой модели, не подкреплённый реальными данными. Снижается за счёт RAG, файнтюна на проверенных данных и человеческой оценки ответов модели.
COCO — формат разметки в JSON, где для каждого изображения хранятся координаты рамок, полигоны сегментации и классы объектов в единой структуре. Один из самых распространённых форматов выгрузки для задач детекции и сегментации.
YOLO — текстовый формат разметки, в котором для каждого объекта на изображении в отдельной строке указаны класс и нормализованные координаты центра, ширины и высоты рамки. Назван по одноимённому семейству моделей детекции реального времени.
DICOM — международный стандарт хранения и передачи медицинских снимков: КТ, МРТ, рентген, который объединяет само изображение и метаданные пациента и исследования в одном файле. Требует деперсонализации перед использованием в обучении моделей.
Глоссарий разметки данных — это справочник из 40 терминов по разметке, датасетам, машинному обучению, метрикам качества и LLM с короткими самостоятельными определениями. Каждый термин снабжён якорем и, где уместно, ссылкой на статью блога или страницу услуги DataMarkup для более глубокого разбора.
Переходите по якорям навигации вверху страницы — по теме или по алфавиту — либо ищите нужный термин через Ctrl+F. Каждая карточка термина самодостаточна: определение можно понять без чтения остальной страницы, а ссылка внутри ведёт к развёрнутому материалу в блоге.
DataMarkup специализируется на разметке данных для машинного обучения, поэтому в глоссарий включены термины, с которыми заказчик реально сталкивается в брифе, гайдлайне и отчёте о качестве: от bounding box и IAA до RLHF и форматов COCO, YOLO, DICOM.
Если термин описывает вашу задачу, посмотрите пилар «Разметка данных для машинного обучения» с полным перечнем услуг и вилками цен, либо откройте блог DataMarkup: там термины разобраны подробнее, с примерами, таблицами сравнения и практическими инструкциями.
Все термины разметки данных, ML и LLM применяются на практике в наших услугах и разобраны подробнее в блоге — выберите, что нужно сейчас.
Пилар: все типы разметки, контроль качества, бесплатный пилот
Гайды, разборы форматов, инструментов и практик контроля качества
SFT, RLHF, RAG, fine-tuning и оценка качества языковых моделей
Вилки цен по типам данных и интерактивный калькулятор