Почему OCR недостаточно
OCR извлекает надписи, но не объясняет стрелки, расположение блоков, график или смысл изображения. Мультимодальная система хранит текстовое и визуальное представления, связанные с одним source object.
Несколько representations
Для страницы можно иметь body text, caption, table representation и image embedding. Named vectors позволяют искать по разным сигналам, а grouping возвращает документ, а не десять фрагментов одной страницы.
Parsing документов
Сохраняйте reading order, bounding boxes, таблицы и изображения вместе с page ID. Caption генерируется как производный артефакт с model version; он не заменяет оригинал.
Query routing
Текстовый вопрос может требовать visual retrieval: «какая линия выше на графике». Router выбирает text, image или оба пути. Исходный query всегда сохраняется, а результаты объединяются и rerank.
Context для модели
Передавайте изображение или crop только если модель и policy это разрешают. Добавляйте surrounding text и точную ссылку на страницу. Не пересказывайте чувствительный рисунок в общий кэш.
Стоимость и latency
Visual embeddings и multimodal calls дороже. Применяйте staged retrieval: дешёвый поиск создаёт candidates, дорогой visual scorer работает на малом наборе.
Оценка
Нужны text-only, image-only и cross-modal вопросы, включая отрицательные. Измеряйте retrieval по modality, answer correctness, citation localization, latency и стоимость.