LOOMA / ДОКУМЕНТАЦИЯ
OCR и индексация без путаницы
В приложении есть три разных вида подготовки документов. Их не нужно запускать заново все вместе.
| Процесс | Что он делает | Когда нужен |
|---|---|---|
| Извлечение текста | Сохраняет текст, который уже есть в PDF, и его координаты | Чтобы искать по словам и выделять их |
| OCR | Распознаёт текст на изображении страницы | Для сканов или текста внутри картинок |
| Визуальная индексация | Рассчитывает эмбеддинги страниц выбранной моделью | Для поиска по смыслу и визуальной похожести |
Настройка OCR#
В Настройки → OCR выберите движок: Apple Vision на macOS или RapidOCR. Режим «только страницы без текстового слоя» экономит время и не распознаёт заново страницы с собственным текстом.
OCR имеет отдельные очередь, прогресс и кнопки паузы и продолжения. Пауза может дождаться завершения текущей операции. Сохранённый OCR участвует в текстовом поиске без повторного расчёта эмбеддингов.
Для одной страницы откройте контекстное меню в просмотрщике и выберите OCR. Это принудительное распознавание без ожидания общей очереди: полезно, если на странице с обычным текстом есть картинка с подписью. Сам расчёт всё равно требует времени.
Слои в просмотрщике#
Если у страницы нет собственного текста, имеющийся OCR включается автоматически. Цветная плашка показывает, какой слой доступен. Если у страницы есть и собственный текст, и OCR, нажмите плашку для переключения. Текст можно выделять и копировать поверх изображения.
Новые документы#
В настройках можно включить:
- Автоматически индексировать новые документы — рассчитывать эмбеддинги при добавлении.
- Автоматически распознавать новые документы без текста — OCR для страниц без текстового слоя.
- Автоматически распознавать новые документы — OCR всех страниц новых документов.
Эти правила применяются к ручному добавлению и поступлению из Anytype. Выберите подходящий режим OCR; включение автоматизации не означает пересчёт всей существующей библиотеки.
Текстовый индекс#
Извлечение недостающих текстов читает уже добавленные PDF и заполняет отсутствующие текстовые слои. Визуальные эмбеддинги не пересчитываются.
Восстановление текстового поиска пересобирает BM25 из сохранённых текстов. Оно не распознаёт страницы и не извлекает отсутствующие тексты. Изменения текста и OCR обычно синхронизируются с индексом автоматически.
Память или PLAID#
По умолчанию используется точный поиск в памяти. Для каждого пространства можно включить PLAID — дополнительный индекс для ускорения поиска по векторам. Он занимает место на диске, использует память при поиске и может давать другой набор кандидатов, чем полный перебор.
Настройки индекса пространства показывают размер и состояние. Там можно создать или перестроить PLAID. Перестроение использует сохранённые эмбеддинги: заново прогонять документы через модель не нужно. Следуйте рекомендации приложения, когда индекс отсутствует, устарел или сильно изменился корпус.
Выбирайте PLAID по измерениям на своей библиотеке. На небольшом объёме поиск в памяти может оказаться достаточно быстрым. Разные пространства могут использовать разные способы одновременно.