Встроенные модели
Yttri поставляется с набором моделей, которые работают прямо на устройстве — без интернета и без отправки данных наружу.
Языковая модель — Qwen3.5-4B
Заголовок раздела «Языковая модель — Qwen3.5-4B»4 миллиарда параметров, квантизация Q4_K_M (~2,7 ГБ на диске), плюс отдельный модуль зрения (~670 МБ) для описания изображений и скриншотов. Нужно не менее 16 ГБ RAM и GPU — Apple Silicon (Metal) или NVIDIA (CUDA).
Делает: теги, сводки писем и заметок, перевод писем, извлечение фактов, описание картинок, черновики — рабочая лошадка фоновой обработки, то, что не видно в чате напрямую, но происходит постоянно на фоне.
Насколько хорошо: для рутинных задач — быстро и достаточно точно. На сложных многошаговых рассуждениях или длинном художественном тексте 4 миллиарда параметров объективно уступают топовым облачным моделям на порядок крупнее — это свойство размера, а не брака конкретно этой модели.
Поиск — multilingual-e5-base и Qwen3-Reranker-0.6B
Заголовок раздела «Поиск — multilingual-e5-base и Qwen3-Reranker-0.6B»Две модели работают в паре. Сначала эмбеддер (multilingual-e5-base, 768 измерений) переводит текст в вектор и быстро находит кандидатов по смыслу — сразу на нескольких языках, без точного совпадения слов. Затем реранкер (Qwen3-Reranker-0.6B) внимательно перечитывает каждого кандидата и уточняет порядок: он медленнее эмбеддера, но точнее, поэтому применяется только к уже отобранному короткому списку.
Делает: поиск по заметкам, письмам, документам и записям; сопоставление сущностей для вики и графа связей.
Насколько хорошо: обе модели небольшие и работают на CPU без GPU — здесь компромисс по качеству не так заметен, как у языковой модели: смысловой поиск внутри вашей личной базы не требует моделей размером с облачные.
Распознавание речи
Заголовок раздела «Распознавание речи»Четыре модели с разным назначением, докачиваются по требованию:
- Nemotron 3.5 ASR (streaming) — модель по умолчанию, скачивается сразу при первом запуске. 40 языковых локалей, для русского — полноценная поддержка (Tier-1), декодирование beam-search. Спроектирована для потоковой расшифровки — то, что вы видите на экране во время записи, ещё до того как она закончится.
- NVIDIA Parakeet TDT — 25 европейских языков, заявленная точность для русского — 5,51% word error rate (доля неправильно распознанных слов).
- Qwen3-ASR — многоязычная, устойчива к шуму и плохому звуку.
- GigaAM-v3 (Sber) — специализация на русской речи.
Насколько хорошо: живая расшифровка во время записи и финальная после остановки — это разные проходы: первый оптимизирован под задержку (чтобы текст успевал за речью), второй — под качество. Модель для собственных записей настраивается в Настройках, для импортированного аудио выбирается при импорте.
Синтез речи — TeraTTSv2
Заголовок раздела «Синтез речи — TeraTTSv2»Ассистент проговаривает ответы вслух встроенной моделью TeraTTSv2 (~472 МБ, ONNX, работает на процессоре). Одна модель читает и русский, и английский — переключаться между движками не нужно, разметку языка она расставляет сама по письменности.
Русские ударения проставляются отдельным слоем на основе RUAccent: словарь ударений, модель для незнакомых слов, восстановление «ё» и разрешение омографов по контексту — без последнего «пришло четыре письма» читалось бы с ударением на «и».
Насколько быстро: примерно в 20 раз быстрее реального времени на процессоре — секунда речи синтезируется за 50 миллисекунд, поэтому ответ начинает звучать без заметной паузы.
Озвучку можно выключить: «Настройки → Запись и голос → Озвучивать ответы».
OCR — PaddleOCR PP-OCRv5 (mobile)
Заголовок раздела «OCR — PaddleOCR PP-OCRv5 (mobile)»Две маленькие ONNX-модели: детектор границ текста (~4,8 МБ) и распознаватель символов для русского, белорусского, украинского и английского (~7,9 МБ). Вместе — около 13 МБ, работают на CPU.
Делает: превращает текст на скриншотах и сканах документов в обычный текст ещё до того, как за дело возьмётся модель со зрением — часто вместо неё.
Насколько хорошо: появилась не случайно — заменила модель зрения именно там, где та стабильно «додумывала» текст на скриншотах вместо того, чтобы читать его точно. Для текст-плотных изображений OCR быстрее и надёжнее: находит реальные символы, а не наиболее вероятные по мнению LLM.
Почему встроенная модель — это не компромисс
Заголовок раздела «Почему встроенная модель — это не компромисс»Встроенная модель — не обвязка «подключи любую модель и надейся». Под каждую из перечисленных выше написан свой инференс: движок и параметры генерации подобраны именно под неё, а не усреднены под все модели сразу.
Эти параметры не выставлены один раз вручную — они проверяются автоматическими тестами на эталонных примерах (тегах, сводках писем, переводах, разборе встреч) и обновляются только тогда, когда новая версия не хуже прежней, иначе откатываются автоматически. Облачная модель стороннего провайдера может измениться без предупреждения и без такой проверки на вашей стороне.
Это не отменяет разницу в размере — языковая модель компактнее облачных, и на сложных сводках это заметно. Но в рамках своего размера она настроена и проверена так, как сторонний сервис проверить нельзя — и именно поэтому для фоновых задач она включена по умолчанию (подробнее — в разделе «Фоновые задачи: главное решение» на странице про роутер): не только ради приватности, но и как надёжный, предсказуемый исполнитель рутины.