GAZPROM NEFTML / DOCUMENT AI
2026 — PRESENTРазработка ML/Document AI решений для технической и архивной документации.
Hybrid HTR pipeline для исторических документов
Полный pipeline распознавания исторических русскоязычных документов: рендер страниц, детекция текстовых строк и регионов RF-DETR, гибридная ветка рукописного OCR (TrOCR) и табличного VLM (Qwen3-VL 4B через LM Studio, OpenAI-compatible API), сборка document JSON и document-level структурное извлечение Qwen3.6 27B с детерминированной валидацией ответа.
- RF-DETR: детекция строк и текстовых регионов (Kansallisarkisto/rfdetr_textline_textregion_detection_model)
- TrOCR: распознавание рукописных кириллических строк (Kansallisarkisto/cyrillic-large-handwritten)
- Qwen3-VL 4B: поиск таблиц на полной странице, возврат bbox, OCR crop таблицы, структура rows — через LM Studio OpenAI-compatible API
- Qwen3.6 27B: извлечение структурированных параметров из очищенного OCR-документа, ответ ограничен JSON Schema
- Deterministic validation: page существует в OCR JSON, evidence буквально присутствует на странице, raw_value внутри evidence, имя параметра и confidence допустимы, file/page соответствуют исходным данным; неподтверждённые записи удаляются, rejected items фиксируются в warnings
- Оптимизация: RF-DETR и TrOCR загружаются один раз, режим --keep-alive, модели LM Studio удерживаются загруженными через TTL
- Повторная VLM-проверка suspicious lines выключена по умолчанию — trade-off quality/cost без отдельного дорогого VLM request на каждую строку
- TILED INFERENCE
- DESKEW
- BATCH OCR
- BBOX DEDUPLICATION
- QUALITY FLAGS
- FALLBACK ROUTING
- JSON SCHEMA
- EVIDENCE VALIDATION
- KEEP-ALIVE MODELS
Preprocessing крупных технических документов для RAG
Предобработка крупных технических документов (TXT / PDF / DOCX) для RAG: text normalization, удаление control chars, NBSP normalization, zero-width cleanup, soft hyphen cleanup, normalization newlines, восстановление переносов слов, удаление цифровых служебных строк, очистка декоративных разделителей, whitespace normalization и structure-aware chunking.
- Chunking: soft limit ≈ 29,500 chars, hard limit = 30,000 chars
- Разрезание по paragraph boundary → semantic block → безопасной позиции до hard limit; избегание маленького последнего chunk
- Infrastructure: n8n, Python task runner, JavaScript task runner, FastAPI, Docker, Linux
- TXT / PDF / DOCX
- STRUCTURE-AWARE CHUNKING
- NORMALIZATION PIPELINE
- N8N
- FASTAPI
- DOCKER
GENERATIVE OUTPUT
IS NEVER TRUSTED BLINDLY.
- TILED INFERENCE
- DESKEW
- BATCH OCR
- BBOX DEDUPLICATION
- QUALITY FLAGS
- FALLBACK ROUTING
- JSON SCHEMA
- EVIDENCE VALIDATION
- KEEP-ALIVE MODELS