Перейти к содержимому

Документы и AI

Извлечение текста. Из PDF, офисных форматов и текстовых файлов текст берётся напрямую. Для изображений и сканов работает распознавание — локальное, без отправки файла наружу.

Индексация. Текст режется на фрагменты и попадает в поиск: и точный полнотекстовый, и векторный, по смыслу. Это то, чем потом пользуется агент.

Описание и теги. Для документа фоном готовятся короткая выжимка и теги — отдельной кнопки для этого нет, всё происходит в очереди фоновых задач после разбора.

Память агента. Из содержимого извлекаются устойчивые факты, люди, компании и проекты; они пополняют wiki агента и связи в графе.

Все эти задачи требуют доступной модели. Если локальная занята, а облако не подключено, они ждут — документ при этом полностью рабочий: открывается, читается, ищется по тексту.

В чате агент умеет:

  • найти документ по смыслу запроса;
  • прочитать его и ответить по содержимому — со ссылкой на источник;
  • сравнить несколько документов, если попросить об этом явно.

Ответ всегда сопровождается источником. Ссылку стоит открывать: это дешевле, чем доверять пересказу.

Разбор, распознавание и индексация выполняются на устройстве. В облако уходит только то, что нужно конкретному запросу к облачной модели, и текст перед отправкой проходит маскирование чувствительных данных — номера карт, счетов, паспортов заменяются заглушками.

Если облачные функции не подключены, поиск и ответы по документам работают на локальной модели.