На этой неделе AI-индустрия снова решила, что спать необязательно. Голос клонируют локально, модели становятся размером с маленькую страну, а разработчики запускают 2,8 триллиона параметров на компьютере с 8 ГБ памяти.
Но между громким заголовком и реальной пользой иногда лежит диск на 1,56 ТБ и скорость около половины минуты на один токен.
Поэтому ниже не просто шесть новостей, а что именно вышло, кому это пригодится и где маркетинг слегка разогнался.
Сначала две поправки к ролику. Новая модель Alibaba называется Qwen3.8-2.4T-A95B, а не Qwen3-Max. У Kimi K3 2,8 трлн параметров, а не 2 трлн. Исправляю здесь, чтобы ошибка не путешествовала дальше по интернету.
6. Pocket TTS: локальное клонирование голоса
Pocket TTS от Kyutai — компактная модель синтеза речи примерно на 100 млн параметров. Она умеет работать локально и создавать голос по короткому аудиореференсу.
Главная идея не в том, что появился ещё один голосовой сервис. Интересно, что генерация может идти на вашем устройстве без постоянной отправки записи во внешний API.
Это полезно для:
- быстрых черновиков озвучки;
- прототипов голосовых интерфейсов;
- локальных приложений;
- экспериментов, где важна приватность;
- пакетной генерации без оплаты каждого запроса.
Но «локально» не означает «можно клонировать кого угодно». Используйте только свой голос или голос человека, который явно дал согласие. И обязательно отмечайте синтетическую озвучку там, где слушатель может принять её за реальную запись.
Ещё один нюанс: результат зависит от качества референса, языка, темпа и железа. Цифра скорости из демонстрации не гарантирует такую же производительность на любом ноутбуке.
5. Hermes Skills Hub: каталог навыков для агента
Hermes Agent развивает систему skills — отдельных инструкций и ресурсов, которые агент загружает под задачу. В Skills Hub можно искать, проверять и устанавливать навыки из нескольких источников.
В ролике прозвучало «90 тысяч навыков». В официальной документации я не нашёл подтверждения именно этой цифры, поэтому не буду делать из неё факт. Каталог действительно агрегирует несколько реестров и умеет устанавливать community skills, но размер меняется, а качество навыков очень разное.
Самое важное здесь не количество. Навык — это инструкция, которой агент будет следовать. В плохом файле могут быть опасные команды, попытка вытащить секреты или просто устаревший процесс.
Перед установкой:
- посмотрите источник;
- прочитайте
SKILL.md; - проверьте, какие скрипты он запускает;
- не передавайте ему ключи без необходимости;
- тестируйте в отдельном проекте.
В Hermes есть сканирование и карантин для опасных навыков. Это хороший слой защиты, но не замена собственной голове.
4. Grok Imagine Image 2: редактирование области и до пяти референсов
xAI выпустила Imagine Image 2. Модель умеет генерировать и редактировать изображения, менять выделенную область, удалять фон и использовать до пяти референсных картинок.
Практическая ценность не в ещё одном генераторе красивых котов. Несколько референсов позволяют отдельно задать персонажа, предмет, стиль и композицию. А локальное редактирование экономит время: не нужно пересобирать удачный кадр из-за одного плохого элемента.
Где тестировать:
- серия визуалов с одним героем;
- карточки продукта;
- быстрые варианты рекламы;
- замена фона;
- исправление деталей без перегенерации всего кадра.
xAI также заявляла высокое место модели в публичном рейтинге на момент релиза. Такие места быстро меняются, поэтому важнее прогнать модель на своей серии из десяти одинаковых задач.
3. Meta Muse Code: агент в терминале и параллельные worktree
Meta показала Muse Code — кодового агента, который работает в терминале, может выполнять задачи в фоне и разводить параллельную работу по изолированным Git worktree.
Звучит технически, но польза простая. Один агент чинит авторизацию, второй обновляет тесты, третий исследует проблему — и они не месят одну рабочую папку одновременно.
Это тот же сдвиг, который уже виден в Codex и других агентных средах: мы двигаемся от одного чата к управлению несколькими исполнителями.
Главная ловушка — считать параллельность бесплатным ускорением. Три агента тратят больше токенов, создают больше изменений и требуют нормального разделения задач. Если дать им размытые поручения, вы получите три версии бардака вместо одной.
2. Qwen3.8-2.4T-A95B: огромная MoE-модель Alibaba
12 августа 2026 года команда Qwen опубликовала Qwen3.8-2.4T-A95B. В названии уже лежит главное: около 2,4 трлн общих параметров и 95 млрд активных параметров на один проход.
Это архитектура Mixture of Experts. Упрощённо: модель очень большая, но на каждый токен включается только часть «экспертов». Так можно наращивать общую ёмкость, не умножая вычисления прямо пропорционально числу всех параметров.
Зачем следить, даже если вы не собираетесь скачивать терабайты весов:
- открытые модели приближаются к закрытым по сложным задачам;
- MoE становится стандартной архитектурой для гигантских моделей;
- длинный контекст и мультимодальность переходят в базовый набор ожиданий;
- конкуренция снижает стоимость сильных моделей через API.
Но «открытые веса» не означают «запускается на обычном ноутбуке». Полная эксплуатация такой модели — инфраструктурная задача.
1. Kimi K3: 2,8 трлн параметров и эксперимент на 8,24 ГБ памяти
Kimi K3 от Moonshot AI — открытая модель класса 2,8 трлн параметров с нативным зрением и контекстом до 1 млн токенов.
Отдельный community-проект kimi-k3-in-c показал, как запустить инференс на одном CPU с пиковым расходом оперативной памяти около 8,24 ГБ. Движок написан на переносимом C99 и сам занимает около 176 КБ.
Звучит как «теперь огромная модель летает на старом ноутбуке». Нет.
Полный чекпоинт занимает примерно 1,56 ТБ на диске. Движок не держит все веса в памяти, а подгружает нужные слои и экспертов с накопителя. В опубликованных измерениях генерация может занимать примерно 26–33 секунды на токен.
То есть это крутой инженерный эксперимент, доказывающий возможность очень дешёвого по памяти запуска. Но не комфортный локальный чат. Один нормальный абзац можно ждать очень долго.
Почему новость важна: разработчики нашли способ обменять скорость на память. Такие техники со временем могут повлиять на локальные модели, серверные системы и устройства с ограниченной RAM.
Что из этого реально попробовать сейчас
Если вы создаёте контент — начните с Pocket TTS и Grok Imagine Image 2.
Если строите агентов — посмотрите, как Hermes организует skills, но внимательно проверяйте источник каждого навыка.
Если пишете код — следите за Muse Code и параллельными worktree, но сначала научитесь нормально дробить задачи.
Qwen3.8 и Kimi K3 сейчас интереснее как сигнал направления индустрии. Скачивать полтора терабайта ради фразы «привет» большинству людей не надо.
Как я фильтрую такие новости
Сначала открываю первоисточник: репозиторий, документацию или сообщение самой компании. Затем разделяю четыре вещи — что уже доступно, что показано только в демо, что измерил автор проекта и что пересказали медиа.
После этого ищу цену громкого результата. Для локальной модели это размер весов и скорость. Для агента — токены и контроль изменений. Для генератора изображений — лимиты, права на данные и повторяемость персонажа.
Один абзац с ограничениями полезнее десяти восторженных постов «всё изменилось». Пробовать инструмент стоит тогда, когда понятно не только что он умеет, но и чем за это платишь.
