LOOMA / ДОКУМЕНТАЦИЯ

OCR и индексация без путаницы

В приложении есть три разных вида подготовки документов. Их не нужно запускать заново все вместе.

Процесс Что он делает Когда нужен
Извлечение текста Сохраняет текст, который уже есть в PDF, и его координаты Чтобы искать по словам и выделять их
OCR Распознаёт текст на изображении страницы Для сканов или текста внутри картинок
Визуальная индексация Рассчитывает эмбеддинги страниц выбранной моделью Для поиска по смыслу и визуальной похожести

Настройка OCR#

В Настройки → OCR выберите движок: Apple Vision на macOS или RapidOCR. Режим «только страницы без текстового слоя» экономит время и не распознаёт заново страницы с собственным текстом.

OCR имеет отдельные очередь, прогресс и кнопки паузы и продолжения. Пауза может дождаться завершения текущей операции. Сохранённый OCR участвует в текстовом поиске без повторного расчёта эмбеддингов.

Для одной страницы откройте контекстное меню в просмотрщике и выберите OCR. Это принудительное распознавание без ожидания общей очереди: полезно, если на странице с обычным текстом есть картинка с подписью. Сам расчёт всё равно требует времени.

Слои в просмотрщике#

Если у страницы нет собственного текста, имеющийся OCR включается автоматически. Цветная плашка показывает, какой слой доступен. Если у страницы есть и собственный текст, и OCR, нажмите плашку для переключения. Текст можно выделять и копировать поверх изображения.

Новые документы#

В настройках можно включить:

Эти правила применяются к ручному добавлению и поступлению из Anytype. Выберите подходящий режим OCR; включение автоматизации не означает пересчёт всей существующей библиотеки.

Текстовый индекс#

Извлечение недостающих текстов читает уже добавленные PDF и заполняет отсутствующие текстовые слои. Визуальные эмбеддинги не пересчитываются.

Восстановление текстового поиска пересобирает BM25 из сохранённых текстов. Оно не распознаёт страницы и не извлекает отсутствующие тексты. Изменения текста и OCR обычно синхронизируются с индексом автоматически.

Память или PLAID#

По умолчанию используется точный поиск в памяти. Для каждого пространства можно включить PLAID — дополнительный индекс для ускорения поиска по векторам. Он занимает место на диске, использует память при поиске и может давать другой набор кандидатов, чем полный перебор.

Настройки индекса пространства показывают размер и состояние. Там можно создать или перестроить PLAID. Перестроение использует сохранённые эмбеддинги: заново прогонять документы через модель не нужно. Следуйте рекомендации приложения, когда индекс отсутствует, устарел или сильно изменился корпус.

Выбирайте PLAID по измерениям на своей библиотеке. На небольшом объёме поиск в памяти может оказаться достаточно быстрым. Разные пространства могут использовать разные способы одновременно.

Нашли неточность? Сообщите на GitHub ↗