Разрабатываем распознавание первичных документов, которое доводит скан УПД, накладной или акта до готового документа в вашей 1С. Обучаем модель на ваших реальных сканах — с печатями, подписями, перекосом и плохим качеством копии, — а не на идеальных образцах. Спорные поля не выдумываем: они уходят оператору на подтверждение, поэтому в учёт не попадают тихие ошибки.

Распознаём весь типовой поток бухгалтерии: УПД, товарные накладные ТОРГ-12, счета-фактуры, акты выполненных работ, счета на оплату и кассовые чеки. Модель обучается под ваших поставщиков, поэтому она читает именно те формы, которые приходят вам, а не абстрактный шаблон из демонстрационного набора.
Универсальный передаточный документ: реквизиты сторон, табличная часть, ставки и суммы НДС.
Номенклатура построчно, количество, цена, итоги — с привязкой к справочнику товаров.
Номер, дата, ИНН и КПП сторон, строки товаров, ставка и сумма налога.
Предмет, период, объём и стоимость работ, подписанты со стороны заказчика.
Реквизиты платежа, позиции и сумма к оплате для автоматической загрузки.
Продавец, ИНН, дата, сумма и НДС для авансовых отчётов по подотчётным лицам.
Начинаем с ваших документов: берём выборку реальных сканов и смотрим, какие формы и какое качество копий приходят на практике. Дальше размечаем поля, обучаем модель, замеряем точность на отложенной выборке и подключаем выгрузку в 1С. Пилот запускается на одном участке — обычно на входящих накладных.
Принимаем сканы и фотографии в PDF, JPG, PNG и TIFF, в том числе многостраничные пачки. Результат отдаём структурированными данными для загрузки в вашу конфигурацию — через обработку, HTTP-сервис или промежуточный файл. Схему интеграции выбираем под то, как устроен ваш обмен, а не наоборот.
Точность зависит от качества копии: чистый электронный PDF читается почти без ошибок, а третья ксерокопия с перекосом и печатью поверх текста — заметно хуже. Поэтому мы не называем процент заранее, а замеряем его на вашей выборке отдельно по каждому полю и фиксируем результат перед стартом работ.
Сумма, ИНН и дата считаются отдельно: цена ошибки в них разная.
Поле ниже порога не подставляется молча, а уходит оператору на подтверждение.
Итоги, ставки и суммы НДС пересчитываются: расхождение — сигнал об ошибке чтения.
Факсы, ксерокопии и фото с телефона набираются в обучение целенаправленно.
Строки товаров привязываются к вашему справочнику, а не заводят дубли.
Обработка и хранение на инфраструктуре в России, по 152-ФЗ.
Стоимость распознавания первички зависит от набора форм и качества сканов. Одна форма вроде ТОРГ-12 с выгрузкой в базу запускается быстро; пакет из УПД, счетов-фактур и актов с проверкой спорных полей человеком требует больше работы. Три типовых объёма со сроками — ниже.
| Объём работ | Стоимость | Срок | Что входит |
|---|---|---|---|
| Один тип документа | от 350 000 ₽ | 4–6 недель | Одна форма, выгрузка в вашу базу, замер точности распознавания |
| Пакет документов | от 800 000 ₽ | 8–10 недель | Основные формы первички, проверка спорных полей человеком, обучение бухгалтерии |
| Полный документооборот | от 2 000 000 ₽ | от 3 месяцев | Все формы, несколько юрлиц, интеграция с ЭДО и архивом |
Отдельные работы и развитие системы после сдачи — 3 000 ₽ за час инженера. Разметка обучающих данных считается отдельно и по своим правилам — от 320 ₽ за час эксперта, а на объёмных задачах — за единицу данных. Вилки — ориентир для планирования бюджета, а не публичная оферта: точную смету и срок называем после разбора задачи и фиксируем в договоре.
Задача одинаково острая везде, где бумажный или сканированный документ вручную перебивают в учётную систему: в бухгалтерском аутсорсинге, оптовой торговле, на складах и в логистике, в строительстве с актами КС-2 и КС-3. Чем больше поставщиков и форм, тем быстрее окупается автоматизация ввода.
Разобрали поток входящих ТОРГ-12 и УПД, разметили выборку с реальными сканами — включая ксерокопии и фото с телефона, — обучили модель и настроили загрузку в 1С с привязкой к справочнику номенклатуры. Поля с низкой уверенностью уходили оператору: ручной работы осталось около 15% строк вместо полного перебивания. Показатели — типовой сценарий проекта такого класса, не кейс конкретного клиента.
Готовый сервис обучен на усреднённом наборе форм и хорошо читает типовые документы. Если у вас много нестандартных форм от конкретных поставщиков, плохие копии или своя доработанная конфигурация, точность на них проседает. Мы обучаем модель под ваш реальный поток и настраиваем интеграцию под вашу схему обмена.
Для оценки достижимой точности хватает 20–50 сканов каждого типа. Для рабочей модели обычно нужны сотни документов на форму, причём ценнее не количество, а разнообразие: разные поставщики, разное качество копий, разные варианты расположения полей.
Оно не подставляется автоматически. Поле с уверенностью ниже порога попадает в очередь на подтверждение оператору. Это принципиальный момент: тихая ошибка в сумме или ИНН обходится дороже, чем несколько секунд ручной проверки.
Печати и подписи распознаются как объекты — система фиксирует их наличие и положение. Рукописные пометки читаются заметно хуже печатного текста, поэтому такие поля мы обычно выводим оператору. Если рукописного много, это обсуждается отдельно на этапе разбора потока.
Да. Если документы нельзя выпускать наружу, распознавание разворачивается на вашем сервере. Плата — расходы на оборудование и обновление моделей своими силами. Такой вариант чаще выбирают компании с требованиями по коммерческой тайне.
Через сопоставление: распознанная строка сравнивается с вашим справочником по названию, артикулу и единице измерения. Однозначные совпадения проставляются автоматически, спорные уходят оператору. Так поток документов не плодит дубли номенклатуры.
Дайте выборку реальных документов — покажем, что распознаётся сразу, а что потребует дообучения, и вернёмся с оценкой за 1 рабочий день.
Не любите формы — напишите на info@datamarkup.ru