Почему OCR недостаточно

OCR извлекает надписи, но не объясняет стрелки, расположение блоков, график или смысл изображения. Мультимодальная система хранит текстовое и визуальное представления, связанные с одним source object.

Несколько representations

Для страницы можно иметь body text, caption, table representation и image embedding. Named vectors позволяют искать по разным сигналам, а grouping возвращает документ, а не десять фрагментов одной страницы.

Parsing документов

Сохраняйте reading order, bounding boxes, таблицы и изображения вместе с page ID. Caption генерируется как производный артефакт с model version; он не заменяет оригинал.

Query routing

Текстовый вопрос может требовать visual retrieval: «какая линия выше на графике». Router выбирает text, image или оба пути. Исходный query всегда сохраняется, а результаты объединяются и rerank.

Context для модели

Передавайте изображение или crop только если модель и policy это разрешают. Добавляйте surrounding text и точную ссылку на страницу. Не пересказывайте чувствительный рисунок в общий кэш.

Стоимость и latency

Visual embeddings и multimodal calls дороже. Применяйте staged retrieval: дешёвый поиск создаёт candidates, дорогой visual scorer работает на малом наборе.

Оценка

Нужны text-only, image-only и cross-modal вопросы, включая отрицательные. Измеряйте retrieval по modality, answer correctness, citation localization, latency и стоимость.

С чего начать?
С ограниченного корпуса, реальных запросов и измеримого baseline. Зафиксируйте версии данных, retrieval и модели до эксперимента.
Какие метрики обязательны?
Retrieval quality, correctness ответа, p95 latency, стоимость и ошибки по отдельным сегментам запросов.
Можно ли копировать настройки из документации?
Только как baseline. Финальные параметры выбираются по вашему корпусу, фильтрам, языку и нагрузке.
Как выпускать изменение?
Собрать новую версию рядом, прогнать offline eval и shadow, затем canary с готовым rollback.
Что логировать?
Trace ID, версии pipeline и индекса, transformed queries, candidate IDs, filters и итоговые метрики без лишнего чувствительного payload.
Как избежать утечки данных?
Проверять identity и ACL до retrieval, изолировать кэши и повторно проверять права при показе citations.
← Все статьи блога