Перейти к содержимому

Встроенные модели

Yttri поставляется с набором моделей, которые работают прямо на устройстве — без интернета и без отправки данных наружу.

4 миллиарда параметров, квантизация Q4_K_M (~2,7 ГБ на диске), плюс отдельный модуль зрения (~670 МБ) для описания изображений и скриншотов. Нужно не менее 16 ГБ RAM и GPU — Apple Silicon (Metal) или NVIDIA (CUDA).

Делает: теги, сводки писем и заметок, перевод писем, извлечение фактов, описание картинок, черновики — рабочая лошадка фоновой обработки, то, что не видно в чате напрямую, но происходит постоянно на фоне.

Насколько хорошо: для рутинных задач — быстро и достаточно точно. На сложных многошаговых рассуждениях или длинном художественном тексте 4 миллиарда параметров объективно уступают топовым облачным моделям на порядок крупнее — это свойство размера, а не брака конкретно этой модели.

Две модели работают в паре. Сначала эмбеддер (multilingual-e5-base, 768 измерений) переводит текст в вектор и быстро находит кандидатов по смыслу — сразу на нескольких языках, без точного совпадения слов. Затем реранкер (Qwen3-Reranker-0.6B) внимательно перечитывает каждого кандидата и уточняет порядок: он медленнее эмбеддера, но точнее, поэтому применяется только к уже отобранному короткому списку.

Делает: поиск по заметкам, письмам, документам и записям; сопоставление сущностей для вики и графа связей.

Насколько хорошо: обе модели небольшие и работают на CPU без GPU — здесь компромисс по качеству не так заметен, как у языковой модели: смысловой поиск внутри вашей личной базы не требует моделей размером с облачные.

Четыре модели с разным назначением, докачиваются по требованию:

  • Nemotron 3.5 ASR (streaming) — модель по умолчанию, скачивается сразу при первом запуске. 40 языковых локалей, для русского — полноценная поддержка (Tier-1), декодирование beam-search. Спроектирована для потоковой расшифровки — то, что вы видите на экране во время записи, ещё до того как она закончится.
  • NVIDIA Parakeet TDT — 25 европейских языков, заявленная точность для русского — 5,51% word error rate (доля неправильно распознанных слов).
  • Qwen3-ASR — многоязычная, устойчива к шуму и плохому звуку.
  • GigaAM-v3 (Sber) — специализация на русской речи.

Насколько хорошо: живая расшифровка во время записи и финальная после остановки — это разные проходы: первый оптимизирован под задержку (чтобы текст успевал за речью), второй — под качество. Модель для собственных записей настраивается в Настройках, для импортированного аудио выбирается при импорте.

Ассистент проговаривает ответы вслух встроенной моделью TeraTTSv2 (~472 МБ, ONNX, работает на процессоре). Одна модель читает и русский, и английский — переключаться между движками не нужно, разметку языка она расставляет сама по письменности.

Русские ударения проставляются отдельным слоем на основе RUAccent: словарь ударений, модель для незнакомых слов, восстановление «ё» и разрешение омографов по контексту — без последнего «пришло четыре письма» читалось бы с ударением на «и».

Насколько быстро: примерно в 20 раз быстрее реального времени на процессоре — секунда речи синтезируется за 50 миллисекунд, поэтому ответ начинает звучать без заметной паузы.

Озвучку можно выключить: «Настройки → Запись и голос → Озвучивать ответы».

Две маленькие ONNX-модели: детектор границ текста (~4,8 МБ) и распознаватель символов для русского, белорусского, украинского и английского (~7,9 МБ). Вместе — около 13 МБ, работают на CPU.

Делает: превращает текст на скриншотах и сканах документов в обычный текст ещё до того, как за дело возьмётся модель со зрением — часто вместо неё.

Насколько хорошо: появилась не случайно — заменила модель зрения именно там, где та стабильно «додумывала» текст на скриншотах вместо того, чтобы читать его точно. Для текст-плотных изображений OCR быстрее и надёжнее: находит реальные символы, а не наиболее вероятные по мнению LLM.

Почему встроенная модель — это не компромисс

Заголовок раздела «Почему встроенная модель — это не компромисс»

Встроенная модель — не обвязка «подключи любую модель и надейся». Под каждую из перечисленных выше написан свой инференс: движок и параметры генерации подобраны именно под неё, а не усреднены под все модели сразу.

Эти параметры не выставлены один раз вручную — они проверяются автоматическими тестами на эталонных примерах (тегах, сводках писем, переводах, разборе встреч) и обновляются только тогда, когда новая версия не хуже прежней, иначе откатываются автоматически. Облачная модель стороннего провайдера может измениться без предупреждения и без такой проверки на вашей стороне.

Это не отменяет разницу в размере — языковая модель компактнее облачных, и на сложных сводках это заметно. Но в рамках своего размера она настроена и проверена так, как сторонний сервис проверить нельзя — и именно поэтому для фоновых задач она включена по умолчанию (подробнее — в разделе «Фоновые задачи: главное решение» на странице про роутер): не только ради приватности, но и как надёжный, предсказуемый исполнитель рутины.