Xtracta: где скачать и как пользоваться

2026-09-11 17:15:50 Время чтения 46 мин 23

Xtracta — облачная система интеллектуальной обработки документов: она принимает PDF, сканы, фотографии и офисные файлы, извлекает реквизиты и повторяющиеся строки, применяет преобразования и проверки, а затем передаёт структурированные данные дальше. На странице Xeon Live можно скачать Xtracta бесплатно и быстро перейти к сервису; ниже разберём рабочий процесс без рекламных обещаний — от первой загрузки до контроля результата и интеграции.

Xtracta в двух словах: назначение и границы

Xtracta не редактирует страницы PDF как обычный PDF-редактор. Её задача — превратить неоднородные документы в данные для учётных, финансовых, логистических и отраслевых систем. Основой служит workflow: набор полей, правил, очередей проверки и способов вывода.

Список рабочих потоков и счётчики очередей на домашней странице Xtracta

Сервис работает через браузер. На домашнем экране видны доступные workflow и счётчики Indexing, QA, Reject, Processing и Output Queue. Они показывают, где именно накапливаются документы и на каком этапе требуется вмешательство.

Xtracta требует заранее описанного процесса: полей, повторяющихся наборов, очистки, проверок, справочников и вывода. Она автоматизирует повторяемую часть работы, но не заменяет профессиональное решение по содержанию документа.

Интерфейс Xtracta: карта рабочих областей

Интерфейс разделён на Dashboard для потока документов и New ELS для работы с конкретным файлом. Dashboard хранит очереди и статусы, а New ELS показывает страницу, извлечённые поля, повторяющиеся строки, сведения о Class и Design и действия над документом.

Dashboard: очереди, фильтры и состояние документов

Dashboard выбранного workflow: очереди, фильтры и действия над документами

После выбора workflow открывается Dashboard. В верхней части размещены Overview, My Files, Indexing, Quality Assurance, Rejected, Recycle Bin, File Tracking и History. Таблица ниже содержит ID, число страниц, статус, очередь, время получения, последнюю активность и дополнительные бизнес-поля, которые выведены администратором. Кнопка Process next ready document берёт следующую готовую запись без ручного поиска, а фильтр помогает сузить набор по нужному состоянию или значению.

Overview даёт общий контроль, Indexing — ручную проверку и обучение, QA — второй уровень контроля. My Files закрепляет документ за оператором, Rejected показывает причину отказа, File Tracking — хронологию, History — уже обработанные записи.

New ELS: документ, поля и таблица в одном экране

New ELS: документ, поля извлечения и строки в одном рабочем экране

New ELS объединяет несколько панелей. Document Preview показывает страницы и позволяет управлять многостраничным файлом. Центральная область Data Source отображает сам документ. Справа Data Extraction выводит поля шапки и текущие значения. Внизу Repeating Field Set ведёт себя как электронная таблица для строк товаров, транзакций или других повторяющихся записей. Document Information показывает Class, Design, Page Count и Revision — эти сведения особенно важны при диагностике неверного обучения.

В верхней панели находятся действия над текущим документом. Exit & Unlock возвращает запись в прежнее состояние без завершения. Save сохраняет исправления без обучения. Save and Learn закрывает документ и передаёт подтверждённые значения в обучение согласно конфигурации. Output завершает обработку и запускает настроенные выходы. Send to QA переводит запись на дополнительную проверку, Reject Document отправляет её в отклонённые с причиной, My Files закрепляет за текущим пользователем, Reassign переносит в другой доступный workflow.

Как загрузить документ и довести его до Indexing

Первый практический сценарий — ручная загрузка и контроль того, что документ дошёл до очереди проверки. Он подходит для первоначальной настройки workflow, тестовой партии и единичных файлов. Перед началом определите, в какой workflow должен попасть документ: одинаковый PDF, отправленный в поток счетов и в поток договоров, будет обрабатываться по разным полям и правилам.

Загрузка через Web Uploader

Меню Upload Documents с загрузкой с компьютера, по email и FTP
  1. Откройте My Workflows и выберите нужный workflow. Проверьте его название и назначение, чтобы не смешать разные типы документов.
  2. Нажмите Upload Documents и выберите Upload from computer. В появившемся окне перетащите файл или выберите его через системный диалог.
  3. До отправки убедитесь, что документ открывается без пароля. Xtracta принимает PDF, DOC, DOCX, ODS, ODT, XLS, XLSX, а среди изображений — GIF, HEIC, JPG/JPE/JPEG, PNG, TIF и TIFF.
  4. Для Web Uploader учитывайте предел размера отдельного файла 100 МБ и максимальный размер POST 110 МБ. Файл крупнее следует подготовить заранее или направить по поддерживаемому каналу, рассчитанному на больший объём.
  5. После загрузки вернитесь в Dashboard. Новый документ получает Document ID и сначала проходит pre-processing: подготовку страниц, OCR, классификацию, извлечение, преобразования и проверки.
  6. Не нажимайте повторную загрузку только потому, что запись несколько минут остаётся в Processing. Сначала проверьте Page Count, размер исходника и Last Activity; повторная отправка создаст ещё один документ и усложнит контроль дублей.

Для сканов качество исходника напрямую влияет на распознавание. Страница должна быть целиком в кадре, без блика, перспективного искажения и обрезанных полей. Для цифрового PDF сохраняйте исходный файл, а не фотографию экрана. В отдельной инструкции Xeon Live разобраны базовые принципы распознавания текста в PDF, которые полезны при подготовке проблемных сканов до загрузки в Xtracta.

Как убедиться, что файл попал в нужную очередь

Indexing показывает документы, готовые к операторской проверке
  1. Откройте Overview и найдите запись по Document ID. Для теста удобнее фиксировать ID сразу после появления документа — он связывает Dashboard, File Tracking и дальнейшие операции.
  2. Проверьте STATUS. Ready означает, что первичная обработка завершилась и запись доступна для ручной работы. Processing означает, что один из этапов ещё не закончен.
  3. Посмотрите QUEUE. Для нового workflow ожидаемым местом обычно становится Indexing, потому что первые документы требуют проверки и обучения. Конкретное направление задаётся конфигурацией workflow.
  4. Откройте вкладку Indexing и убедитесь, что строка появилась там. Значок глаза открывает документ, а Process next ready document берёт следующую готовую запись.
  5. При отсутствии документа проверьте Rejected и Error Documents. Rejected относится к нарушениям валидации после извлечения, Error Documents — к файлам, которые система не способна нормально обработать из-за пароля, физических размеров, количества страниц или других входных проблем.
  6. Для задержки откройте File Tracking и сравните Received Time и Last Activity. Так видно, действительно ли обработка продолжается, запись закреплена пользователем или остановилась на следующем этапе.

После этого исходная задача считается выполненной только тогда, когда документ имеет понятный статус и находится в ожидаемой очереди. Для рабочего процесса важен не факт успешной загрузки, а предсказуемое прохождение до Indexing, QA, Rejected или Output. Такой контроль предотвращает ситуацию, когда файл физически принят, но неделями остаётся в личной очереди или в pre-processing.

Как проверить и исправить извлечённые поля в New ELS

Основная операторская работа выполняется в New ELS. Цель — не перепечатать документ вручную, а подтвердить правильные значения, исправить ошибки и понять их источник. Важно разделять три уровня: OCR прочитал текст, модель выбрала нужный фрагмент, затем правила преобразовали результат. Ошибка на каждом уровне исправляется по-разному.

Проверка полей шапки и ручное выделение значения

Панель Data Extraction с полями документа
  1. Откройте документ из Indexing. Сначала посмотрите Document Information и убедитесь, что Class и Design соответствуют типу документа. Неверная классификация делает последующее обучение полей рискованным.
  2. Перейдите в Data Extraction. Начните с обязательных полей: поставщик, номер документа, дата, валюта, сумма, номер заказа или другие поля, предусмотренные конкретным workflow.
  3. Выберите поле и найдите соответствующий фрагмент на странице. Автоматически извлечённые значения подсвечиваются зелёным, ручное выделение — синим.
  4. При неверном значении выделите правильный фрагмент на документе. Старайтесь выбирать само значение без подписи и лишних соседних символов: модель должна учиться на содержимом поля, а не на случайном заголовке.
  5. Сверьте результат после преобразований. У суммы проверьте десятичный разделитель и знак, у даты — порядок дня, месяца и года, у идентификатора — ведущие нули и похожие символы.
  6. При непонятной подмене временно отключите для поля Strip and Replace, Data Matching или Auto Format через доступные переключатели New ELS. Сравните исходное распознанное значение с результатом после каждого этапа.
  7. Если проблема находится в OCR, не обучайте поле на ошибочно прочитанной строке. Исправьте качество исходника или примените повторное OCR, затем снова проверьте выделение.

Фильтры Error, Trained и Most Common сокращают панель до нужного набора. Error удобен для документа с несколькими десятками полей: оператор сначала разбирает только нарушения. Trained показывает значения, пришедшие из обученной модели. Most Common выводит часто вводимые пользователями варианты. Clear All Fields удаляет текущие значения, а Reload Prefilled Data возвращает предварительно заполненные данные, поэтому обе команды следует применять осознанно.

Проверка строк таблицы в Repeating Field Set

Повторяющийся набор полей для товарных строк, операций и других табличных данных
  1. Перейдите в Repeating Field Set и сопоставьте колонки с фактической таблицей документа. Для счёта это обычно код, описание, количество, единица, цена, скидка, налог и итог строки; конкретный набор задаёт workflow.
  2. Сначала сравните число строк в ELS с числом строк в исходном документе. Лишняя строка часто появляется из-за переноса описания, а пропущенная — из-за нестабильной структуры или слабого распознавания.
  3. Проверяйте строки последовательно слева направо. Один неверный столбец способен вызвать арифметическое отклонение всего документа, поэтому удобнее сначала восстановить структуру таблицы, затем суммы.
  4. При пропущенной записи используйте Add Row. Для повторяющегося значения применяйте Duplicate Row или Copy Value to Fields Below, когда это соответствует документу.
  5. При лишней записи удалите строку через Row Options. Не очищайте всю колонку, если ошибка локальная: Clear Column Data удаляет значения по всем строкам текущего столбца.
  6. Если данные попали не в тот столбец, примените Swap Column Data или Move Column Data. После переноса проверьте минимум первую, среднюю и последнюю строки, чтобы убедиться, что операция затронула ожидаемый диапазон.
  7. В конце сверьте количество строк и арифметику. Для банковской выписки дополнительно сравните начальный и конечный баланс; для счёта — суммы строк, налог и итог документа.

При точечном извлечении таблиц из текстовых PDF полезно понимать разницу между специализированным табличным инструментом и системой документного потока. В материале Xeon Live о том, как извлечь таблицу из PDF, рассмотрены отдельные способы. Xtracta идёт дальше: повторяющиеся строки становятся частью общего workflow вместе с проверкой, обучением и выводом.

Как ускорить работу с колонками, строками и навигацией

Операции с колонкой: цвет подсветки, перенос, обмен, очистка и история
  1. Наведите указатель на заголовок колонки и откройте Column Options. Highlight Color задаёт цвет подсветки для выбранного столбца; Random быстро разносит цвета по колонкам.
  2. Используйте разные цвета для визуально похожих полей, например количества, цены и итоговой суммы. Настройка сохраняется для пользователя и снижает риск выделить число не в ту колонку.
  3. Для строк применяйте сочетания, показанные в Row Options: Duplicate Row — Ctrl+Shift+D, Add row above — Ctrl+Shift+<, Add row below — Ctrl+Shift+>, Remove row — Ctrl+Shift+Backspace.
  4. В Preferences включите Scroll on Tab Press. После этого клавиша Tab переводит фокус между полями и прокручивает ELS к следующему значению, что ускоряет последовательную проверку длинной формы.
  5. После настройки пройдите один документ полностью только клавиатурой там, где это удобно, и отметьте места, где всё равно требуется выделение мышью. Так рабочее место настраивается под реальный поток, а не под абстрактный набор команд.

Как обучать Xtracta и сокращать ручные исправления

Обучение в Xtracta строится вокруг подтверждённых примеров. Программа различает простое сохранение и передачу данных в обучение, поэтому оператору важно не нажимать Save and Learn автоматически. Случайный плохой скан, единичная рукописная пометка или документ с неверным классом не должен становиться образцом для последующих файлов.

Learn & Extract для однотипных строк

Операции со строкой и сочетания клавиш в New ELS
  1. Откройте документ в New ELS и перейдите к повторяющемуся набору. Для чистого обучения удобно удалить явно ошибочные автоматически созданные строки и добавить одну корректную строку.
  2. В первой строке поочерёдно выделите значения на документе для каждой нужной колонки. Сохраняйте одинаковую логику выбора: код только из колонки кода, цена только из цены, описание без соседних ячеек.
  3. После разметки хотя бы одной строки нажмите Learn & Extract. Xtracta применит распознанный рисунок к остальным строкам текущей таблицы.
  4. Для сложной структуры обучите две или больше строк до запуска Learn & Extract. Это особенно важно при переносах описания, пустых ячейках, разных форматах количества и нескольких ставках налога.
  5. Проверьте верх таблицы, середину и последнюю строку. Сравните число созданных записей с документом и убедитесь, что итоги не были приняты за обычные товарные строки.
  6. Исправьте локальные ошибки. Learn & Extract ускоряет первичное заполнение, но не отменяет контроль результата.
  7. Завершите документ через Save and Learn или Output только после полной проверки. Само использование Learn & Extract не запускает долговременное обучение модели.

Для нестабильных таблиц полезнее несколько аккуратно размеченных документов, чем большой набор с противоречивыми примерами. В обучающую выборку стоит включить разные длины таблиц, валюты, кредит-ноты, цифровые PDF и сканы. Цель — показать повторяющиеся закономерности, а не запомнить один конкретный лист.

Field History, Class и Design: как понять причину ошибки

Document Information помогает проверить Class, Design и ревизию документа
  1. При повторяющейся ошибке откройте Document Information и сравните Current Classification с ожидаемыми Class и Design. Несоответствие класса исправляется до обучения полей.
  2. В меню поля откройте Field History. Learning History показывает прежние примеры обучения, которые влияют на выбранное поле, когда эта функция включена в workflow.
  3. Перейдите в Data History, чтобы увидеть изменения текущего поля: исходное и обновлённые значения, пользователя или System, ревизию и время изменения.
  4. Сопоставьте историю с текущей подсветкой на документе. Старый пример от прежнего макета объясняет систематический выбор соседней подписи или неправильной области.
  5. Исправьте текущий документ и выполните Save and Learn только после подтверждения, что он относится к правильному Class и Design.
  6. На следующих документах того же типа контролируйте зелёную автоматическую подсветку и число ручных исправлений. Улучшение определяется повторяемым результатом, а не успешным сохранением одного примера.

Design описывает визуальный вариант внутри одного класса. Один поставщик действительно присылает несколько вариантов счёта — старую и новую форму, разные языки, документы из разных систем. Их объединяют по бизнес-смыслу полей, но обучение должно учитывать устойчивый макет. Создание отдельного дизайна для каждого единичного документа, наоборот, дробит модель и усложняет сопровождение.

Как разделять, переставлять и переназначать страницы

Многостраничные пакеты требуют отдельного контроля. Один PDF содержит либо один логический документ на нескольких страницах, либо несколько документов, склеенных вместе. Неверная граница ломает классификацию, количество строк и итоговые суммы, поэтому разделение выполняется до обучения извлечения.

Ручное разделение и перестановка в New ELS

Document Preview показывает страницы и даёт доступ к операциям с многостраничным документом
  1. Загрузите многостраничный файл и откройте его в New ELS. В Document Preview убедитесь, что все страницы присутствуют и идут в ожидаемом порядке.
  2. Откройте Edit Document в верхней части панели страниц. Между страницами появятся точки разделения.
  3. Найдите границу, после которой начинается новый логический документ, и нажмите Split Document. Страницы после выбранной границы образуют новую запись.
  4. Повторите операцию только на реальных границах документов. Не делите выписку по каждой странице, когда таблица и баланс продолжаются на следующем листе.
  5. При неправильном порядке перетащите страницы в нужную последовательность. При ошибочном действии используйте Undo.
  6. Сохраните изменения. Изменённые документы проходят повторное извлечение, поэтому после разделения ещё раз проверьте Class, Design, число страниц и строки.
  7. Зафиксируйте новые Document ID. Каждая созданная часть становится самостоятельным документом, и интеграция должна учитывать связь с исходным пакетом.

Автоматическое разделение и Reassign Pages

Document Creation Method в Workflow Designer: Single File или Detect automatically
  1. Откройте Workflow Designer и перейдите в настройки Input & Document Flow. В параметре Document Creation Method выберите Detect automatically только для потока, где регулярные пакеты действительно содержат несколько документов.
  2. Подготовьте тестовую серию: чистые границы, пустые страницы, приложения и варианты без явного заголовка. Пропустите её через workflow и сравните созданные Document ID с ожидаемым количеством документов.
  3. При ошибочном разделении вернитесь в Dashboard и используйте Reassign Pages. Укажите Source Document ID и номера Source Pages, которые нужно перенести.
  4. Для создания самостоятельной записи выберите Target Type New. Для возврата страниц к существующему документу используйте существующую целевую запись и укажите позицию вставки.
  5. После Reassign дождитесь повторной обработки и откройте получившиеся документы. Проверьте порядок страниц, классификацию и извлечённые суммы.
  6. Если один и тот же тип постоянно делится неправильно, корректируйте настройку процесса и обучающие примеры. Ручное переназначение подходит для исключений, а не для постоянной компенсации плохой конфигурации.

Авторазделение влияет и на учёт использования сервиса: после разделения появляются отдельные идентификаторы документов. Поэтому тестирование на репрезентативной серии важно не только для точности, но и для предсказуемого объёма обработки.

Как настроить OCR, преобразования и валидации

После базового обучения наступает этап, который сильнее всего влияет на стабильность автоматизации: выбор OCR и правил после распознавания. В Xtracta обработка идёт последовательно: OCR, Class и Design, извлечение, Strip and Replace, Auto Format, расчёты дат, объединение полей, Data Matching, математические расчёты, индивидуальные и расширенные валидации, затем направление в нужную очередь или Output. Ошибку нужно искать на том этапе, где значение впервые стало неправильным.

Выбор OCR Engine и повторное распознавание

Выбор OCR Engine в настройках workflow
  1. Откройте Workflow Designer и найдите OCR Engine. Доступны Nuance, Nuance Rasterized, Tesseract, Google Vision и Azure OCR.
  2. Для цифровых PDF начните с Nuance, который документация Xtracta рекомендует как основной вариант. Для сканов используйте Nuance Rasterized, когда растровая обработка даёт более стабильный результат.
  3. Для проблемного шрифта и специальных символов сравните Tesseract. Для сложных изображений сравните Azure OCR и Google Vision на одинаковом наборе обезличенных документов.
  4. Учтите маршрут данных: при Azure OCR и Google Vision документ передаётся соответствующему внешнему поставщику OCR; Nuance и Tesseract обрабатываются внутри инфраструктуры Xtracta. Это решение должно соответствовать политике обработки конфиденциальных материалов.
  5. После смены OCR повторно проверьте не только текст, но и извлечение полей. Разные движки создают отличающиеся координаты и идентификаторы слов, поэтому старые обучающие примеры ведут себя иначе.
  6. Для единичного документа используйте Re-OCR then Re-Extract из массовых действий. Для системной проблемы изменяйте workflow после контролируемого сравнения на тестовой серии.

Русский текст поддерживается несколькими доступными методами, включая Nuance, Google Vision и Azure. Для смешанных документов отдельно проверяйте коды, номера и даты: визуально похожие кириллические и латинские символы портят идентификатор даже при читаемом слове. Форматная проверка и сопоставление со справочником выявляют такие ошибки надёжнее визуальной оценки.

Strip and Replace, Auto Format, Data Matching и проверки

Rejected показывает причины отклонения и документы, требующие исправления
  1. Выберите одно проблемное поле и проследите его цепочку. Сначала сравните выделенный текст с тем, что OCR реально прочитал на странице.
  2. Проверьте Strip and Replace. Правила выполняются в порядке полей и в порядке самих правил. Удаляйте только устойчивые лишние символы: валютные знаки, префиксы, пробелы или служебные части.
  3. Проверьте Auto Format. Для дат убедитесь, что ожидаемый формат соответствует региону входных документов. Для сумм сравните десятичный и тысячный разделители.
  4. Проверьте Data Matching. Сопоставление работает со справочниками и запускается циклически до прекращения изменений, поэтому правила не должны возвращать значения в предыдущее состояние.
  5. Добавьте индивидуальные валидации обязательности и формата. Критические требования оформляйте как hard validation; допустимые исключения — как soft validation, которую оператор способен осознанно подтвердить.
  6. Для сумм используйте расширенную математическую проверку. Учитывайте округление, отрицательные значения, кредит-ноты, несколько ставок налога и варианты налога, включённого в цену.
  7. Пропустите через workflow положительные и отрицательные примеры. Корректный документ должен доходить до Indexing, QA или Output, а документ с нарушением — попадать в Rejected с понятной причиной.
  8. При массовом одинаковом Reject исправляйте правило в workflow. Ручное исправление сотен документов скрывает конфигурационную ошибку и не улучшает процесс.

Для сопоставления Xtracta использует встроенные базы. В них хранят поставщиков, клиентов, налоговые ставки, товары и другие справочники; CSV импортирует новую базу или обновляет существующую. Перед подключением Data Matching удалите дубли и нормализуйте значения, иначе неоднозначные совпадения превращаются в скрытую бизнес-ошибку.

Как вывести результат и подключить API

После проверки документ должен покинуть операторскую очередь и передать данные потребителю. Xtracta поддерживает ручное и автоматическое завершение. Для интеграции доступны REST API и webhook, а в настройках вывода встречаются CSV, XLS, SQL, email, download, SFTP, OAuth и S3. Конкретный набор зависит от конфигурации workflow и прав пользователя.

Output, QA и безопасное завершение документа

Quality Assurance предназначена для дополнительной ручной проверки
  1. Перед Output проверьте обязательные поля, строки, итоговые суммы и причины мягких предупреждений. Выход должен запускаться только на подтверждённом документе.
  2. Для критичного процесса отправьте запись в Quality Assurance. QA сохраняет данные и передаёт документ другому уровню проверки, но не запускает конечный вывод.
  3. После независимой проверки откройте документ из QA и выполните Output. Xtracta запустит настроенные выходы и переведёт документ в финальное состояние согласно конфигурации.
  4. Не используйте Save вместо Output для завершённого документа. Save сохраняет текущие правки и возвращает запись в прежнюю очередь, поэтому она продолжает ждать обработки.
  5. Не используйте Skip для документа с важными исправлениями. Skip не завершает работу и несохранённые изменения теряются, когда автоматическое сохранение в workflow отключено.
  6. После Output проверьте принимающую систему. Успешное извлечение не доказывает успешную доставку: интеграция должна фиксировать Document ID, время, результат передачи и идентификатор созданной записи у получателя.

Базовая схема интеграции через REST API

Действия над выбранными документами: повторная обработка, очереди, отслеживание и удаление
  1. Храните API-токен на доверенном сервере. Не вставляйте его в браузерный JavaScript, общедоступный репозиторий, письмо или чат.
  2. Для отправки используйте endpoint загрузки документа и передайте workflow_id вместе с файлом. При успешном приёме сохраните возвращённый Document ID в собственной системе.
  3. Не пытайтесь сразу получить конечные поля после загрузки. Обработка асинхронная: документ проходит pre-processing, OCR, извлечение, преобразования и проверки.
  4. Проверяйте состояние через Document API или принимайте webhook. Для собственного опроса задайте разумный интервал и прекращайте проверку после финального статуса.
  5. После готовности получите подробные данные документа. Для одного документа используйте его ID, для серии — workflow_id и пагинацию.
  6. Обрабатывайте вложенные поля и repeating sets как структурированные данные, не как плоскую строку. Сохраняйте типы: суммы — числа, идентификаторы с ведущими нулями — строки, пустое значение — отдельно от нуля.
  7. После успешной загрузки в целевую систему пометьте документ обработанным в собственной базе и используйте идемпотентную логику. Повторная доставка того же Document ID не должна создавать второй бухгалтерский документ.
  8. Для открытия операторского интерфейса из своей системы применяйте Open Document UI. Возвращаемая ссылка ограничена по времени; формируйте её при необходимости, а не храните как постоянный адрес.
  9. Для долгого хранения оригинала не полагайтесь на старый URL документа. Xtracta перемещает файлы между хранилищами, поэтому при каждом просмотре через API получайте актуальную ссылку.

API особенно полезен для программ, где Xtracta работает как встроенный слой document intelligence. Пользователь остаётся в своей ERP, бухгалтерской или отраслевой системе, а сервис получает файл, возвращает статус и структурированные данные. В таком варианте интерфейс Xtracta нужен администраторам и операторам исключений, а массовый поток идёт автоматически.

Как разбирать ошибки, задержки и повторную обработку

Диагностика в Xtracta эффективна только по этапам. Повторное обучение не исправляет повреждённый PDF, смена OCR не устраняет недоступный SFTP, а Force Reprocess не снимает пароль. Сначала определите, где впервые возникло отклонение: вход, OCR, классификация, извлечение, преобразование, валидация или вывод.

Rejected и Error Documents: разные причины и разные действия

History хранит обработанные записи и даёт повторный доступ к данным
  1. Для Rejected сначала прочитайте Reason(s). Отсутствующее обязательное поле, неверный формат и арифметическое расхождение исправляются в данных или правилах. Ошибка доставки требует проверки конечного канала.
  2. Откройте документ в ELS и сравните подсветку, исходное OCR-значение и результат после преобразований. Исправляйте только тот уровень, где появляется ошибка.
  3. После коррекции повторно проверьте валидации и направьте документ в Output или QA. Не игнорируйте hard validation — такой документ не должен завершаться до исправления.
  4. Для Error Documents проверьте тип входной проблемы. Парольная защита, физический размер страницы и некоторые непропорциональные JPEG требуют исправления исходного файла.
  5. Документы свыше 300 страниц относятся к Error Documents. Для определённых случаев доступен Force Reprocess, а Limit Processed Pages сокращает обработку до первых и последних N страниц.
  6. Acknowledge только убирает ошибку из активного счётчика. Команда не исправляет файл и не запускает обработку заново.
  7. При массовом сбое возьмите один репрезентативный документ, сохраните его ID, текст ошибки и параметры, исправьте причину и повторите обработку только на нём. После подтверждения результата применяйте решение к партии.

Что делать, когда документ долго остаётся в Processing

Preferences: формат времени и переход по полям клавишей Tab
  1. Сначала откройте File Tracking и зафиксируйте Received Time и Last Activity. Большой интервал между ними показывает, что документ долго остаётся на одном этапе.
  2. Сравните проблемный файл с нормальным: число страниц, количество строк, размеры изображения и число активных правил. В Xtracta нагрузка растёт не только с размером PDF, но и с количеством значений в repeating sets.
  3. Для очень больших таблиц используйте New ELS. Документация Xtracta прямо рекомендует новый экран как более эффективный для крупных и сложных документов.
  4. Уберите ненужные поля и преобразования из workflow. Сильное сжатие исходника не является оптимизацией: оно ухудшает OCR и увеличивает ручные исправления.
  5. Проверьте лимит плана. После исчерпания доступного количества новые документы остаются в pre-processing до обновления или изменения плана.
  6. Проверьте My Files. Запись, закреплённая отсутствующим сотрудником, выглядит как задержка процесса, хотя вычислительная обработка уже закончена.
  7. Проверьте Output Queue и принимающий канал. Документ с готовыми полями способен задержаться на передаче, поэтому повторное OCR в такой ситуации ничего не меняет.
  8. После исправления причины сравните Last Activity, финальный статус и данные в целевой системе. Только эта тройная проверка подтверждает восстановление потока.

Плюсы, минусы и кому подходит Xtracta

Разрешения пользователя для конкретных workflow

Xtracta сильнее обычного OCR-сервиса там, где нужна связка распознавания, обучения, ручной проверки, справочников, правил и интеграции. Но именно эта глубина делает продукт избыточным для единичной задачи вроде копирования текста из одного PDF. Перед внедрением стоит оценивать не красивый пример распознавания, а весь путь документа: вход, исключения, подтверждение, аудит и вывод.

Плюсы

  1. Единый workflow от поступления документа до проверенного вывода данных.
  2. New ELS объединяет оригинал, поля, повторяющиеся строки и действия над документом.
  3. Обучение на подтверждённых примерах и отдельный Learn & Extract для повторяющихся строк.
  4. Очереди Indexing, QA, Rejected, My Files, History и File Tracking подходят для распределённой операторской работы.
  5. Поддерживаются преобразования, Data Matching, мягкие и жёсткие проверки, арифметика и справочники.
  6. Несколько способов поступления документов: Web Uploader, email, FTP(S) и API.
  7. REST API позволяет встроить обработку в существующую бизнес-систему и открывать ELS только для исключений.

Минусы

  1. Требуется проектирование workflow: набор полей, правила, проверки и вывод нельзя заменить одной универсальной кнопкой.
  2. Интерфейс ориентирован на английский язык, поэтому русскоязычной команде нужен короткий внутренний регламент с названиями элементов.
  3. Качество зависит от исходных файлов и дисциплины обучения; ошибочный пример способен ухудшить последующее извлечение.
  4. Большие документы с множеством повторяющихся строк и правил дольше обрабатываются и открываются.
  5. Некоторые OCR-движки передают документ внешнему поставщику, что требует отдельного согласования для чувствительных данных.
  6. Старые сохранённые URL оригиналов нельзя считать постоянными; интеграция должна получать актуальные адреса через API.

Кому подойдёт

  1. Бухгалтерии и финансовым службам с постоянным потоком счетов, заказов и выписок.
  2. Логистическим и отраслевым системам, где нужно извлекать данные из документов разных контрагентов.
  3. Командам, которым требуется операторская проверка исключений, второй уровень QA и аудит изменений.
  4. Разработчикам SaaS и корпоративных систем, которым нужен API-слой интеллектуального извлечения документов.

Кому не подойдёт

  1. Пользователю, которому нужно один раз скопировать текст или таблицу из PDF без настройки процесса.
  2. Задачам полноценного визуального редактирования PDF, верстки страниц, аннотаций и подготовки документа к печати.
  3. Процессам без готовности описать поля, правила валидации, роли операторов и конечный формат данных.

Xtracta и альтернативы: что сравнивать перед выбором

Фильтры панели полей ускоряют проверку ошибок и обученных значений

Сравнивать Xtracta стоит с системами intelligent document processing. ABBYY Vantage, Rossum, Nanonets и Azure AI Document Intelligence решают сходную задачу, но различаются моделью обучения, операционным интерфейсом, интеграциями и тем, насколько готовый продукт закрывает весь путь документа.

Для разработческой архитектуры полезно отдельно изучить Azure AI Document Intelligence. Для автоматизации документов внутри более широких бизнес-процессов сопоставьте подход с Automation Anywhere Document Automation. А для узкой задачи извлечения таблиц из текстового PDF без корпоративного workflow достаточно более простого Tabula.

Выбор стоит проверять по пяти точкам: источники документов, разнообразие макетов, работа с исключениями, правила качества и конечная система. Xtracta особенно уместна, когда эти этапы нужно связать в один контролируемый процесс.

Итоговые рекомендации по запуску Xtracta

Auto refresh и Stop auto refresh на домашней странице

Начните с одного типа документа. Оставьте нужные поля, настройте repeating set, вход и OCR, загрузите тестовую серию. Первые документы ведите через Indexing и обучайте после проверки.

После стабилизации подключите Strip and Replace, Auto Format, Data Matching и валидации. Настройте понятный Reject, затем QA и разделение страниц. Автоматический Output и интеграцию включайте после того, как тестовая серия проходит предсказуемо.

Для эксплуатации разделите роли: оператор ведёт Indexing и исключения, контролёр принимает QA, администратор отвечает за workflow и права, интегратор — за API и конечный канал. File Tracking и Data History используйте для аудита, Field History — для диагностики обучения.

1 / 3