
Команда DiffusionGemma из Google DeepMind представила экспериментальную языковую модель, которая формирует текст не строго по одному токену, а параллельно перерабатывает блоки по 256 позиций. На одном ускорителе NVIDIA H100 скорость генерации достигла примерно 1500 выходных токенов в секунду.
DiffusionGemma создана на основе Gemma 4 26B A4B. Всего модель содержит 25,2 млрд параметров, но во время работы активирует около 3,85 млрд. Google DeepMind не обучала её с нуля: на преобразование готовой авторегрессионной модели ушло менее 10% от первоначального объёма обучающих токенов Gemma 4.
Модель сначала создаёт черновик целого блока
Обычная языковая модель пишет ответ последовательно: выбирает первый токен, затем второй и продолжает двигаться слева направо. Уже выпущенную часть текста она, как правило, не переписывает.
DiffusionGemma работает иначе. Модель начинает с зашумлённого блока длиной 256 токенов и несколько раз перерабатывает его целиком. С каждым проходом случайная последовательность становится более связной, а начало, середина и конец фрагмента могут влиять друг на друга.
Проще говоря, обычная LLM печатает фразу слово за словом, а DiffusionGemma сначала создаёт черновик фрагмента и одновременно исправляет его во всех местах.
Максимально предусмотрено 48 проходов очистки, но благодаря адаптивной остановке в среднем модели требуется около 12. За один проход она окончательно формирует примерно 20 токенов.
После завершения очередного блока DiffusionGemma фиксирует его и переходит к следующим 256 позициям. Поэтому речь не идёт о мгновенной параллельной генерации ответа любой длины: одновременно перерабатываются отдельные фрагменты.
Почти пятикратное ускорение потребовало компромисса
В тестах DiffusionGemma показала среднюю скорость 1479 токенов в секунду. Исходная Gemma 4 на том же ускорителе выдавала 204 токена в секунду, а её вариант со спекулятивным декодированием — 303 токена.
Таким образом, новая схема оказалась примерно в 7,1 раза быстрее обычной Gemma 4 и в 4,8 раза быстрее её ускоренного варианта.
Результат был получен на одной NVIDIA H100 в режиме FP8 при одном активном запросе. Входной контекст составлял 4096 токенов, ответ — 1024 токена. В показатель скорости не включили время предварительной обработки входного текста.
Однако ускорение далось ценой некоторого снижения качества. На математическом тесте AIME 2026 DiffusionGemma получила 69,1 балла против 84,2 у обычной Gemma 4. На GPQA Diamond результат составил 73,2 против 79,8, на LiveCodeBench — 69,1 против 71,4, а на HumanEval — 94,5 против 98,2.
При этом DiffusionGemma сохранила возможность работать в обычном авторегрессионном режиме. Авторы рассматривают это как основу для гибридной системы: срочные и хорошо структурированные запросы можно отправлять в быстрый диффузионный режим, а задачи, где важнее максимальное качество, — в традиционный.
JSON и код оказались удобными задачами
Особенно заметно преимущества новой архитектуры проявляются в структурированных ответах: JSON, извлечении данных, редактировании программного кода и других задачах, где большая часть результата подчиняется строгому формату.
В таких случаях DiffusionGemma способна завершить обработку блока за два-три прохода. Модель одновременно видит скобки, названия полей, повторяющиеся конструкции и фрагменты исходного текста, поэтому может быстро закрепить предсказуемые части ответа.
Двунаправленная обработка также позволяет изменить начало фрагмента с учётом результата, появившегося ближе к его концу.
В одном из примеров обычная Gemma 4 сначала выдала неправильный ответ на арифметическую задачу, а затем в собственном объяснении обнаружила ошибку и дописала исправление. DiffusionGemma прошла через несколько неверных вариантов внутри черновика, но до публикации переработала начало и сразу показала правильный результат. На это потребовалось пять проходов.
Этот пример не означает, что диффузионная модель рассуждает лучше в целом: по совокупности тестов она уступает исходной Gemma 4. Но он показывает главное архитектурное отличие — модель способна исправить ещё не опубликованный текст, а не объяснять ошибку после её появления в ответе.
При большой нагрузке обычная Gemma снова выходит вперёд
DiffusionGemma особенно эффективна при одном запросе или небольшом числе одновременных пользователей. Примерно при 32 параллельных запросах авторегрессионная Gemma 4 начинает догонять её по общей пропускной способности, а при дальнейшем росте нагрузки — выходить вперёд.
Причина заключается в устройстве вычислений. Диффузионная модель выполняет меньше проходов и реже переносит данные из памяти ускорителя, но каждый её проход значительно тяжелее. Когда GPU уже плотно занят множеством запросов, традиционная последовательная генерация начинает использовать оборудование эффективнее.
Полноценные испытания DiffusionGemma в условиях реального серверного трафика команда пока не проводила.
Среди других ограничений разработчики называют склонность к слишком коротким ответам, редкие циклы с повторением одного и того же токена и ошибки технического форматирования в мультимодальных задачах. Например, на тесте MMMU-Pro режим с рассуждением получил 54,3 балла, а вариант без него — 66 баллов: модель иногда не закрывала специальный тег рассуждения.
Google DeepMind выпустила веса DiffusionGemma под лицензией Apache 2.0 и подготовила реализации для Hugging Face Transformers и vLLM. Разработчики смогут дообучать модель и проверять, в каких сценариях параллельное редактирование текста действительно выгоднее привычной генерации слева направо.
DiffusionGemma пока не заменяет обычные языковые модели. Но работа показывает другой путь ускорения: ответы можно получать быстрее не только благодаря новым чипам, но и за счёт отказа от обязательной печати текста по одному токену.
Читайте также:
В 2028 году астероид размером около 800 метров пройдёт внутри орбиты Луны
SK hynix и Sandisk представили память между HBM и SSD — до 512 ГБ и 3 ТБ/с
AstraZeneca обсуждала слияние с Bristol Myers на $400 млрд
Doosan купила контроль над SK Siltron за $1,6 млрд ради бума ИИ
Alibaba выпустила Qwen3.8-Max на 2,4 трлн параметров
60 тысяч человек прорвались в Сеуту: почему граница Испании с Марокко исчезла за сутки
GPS превратили в космический радар: спутники ESA начали искать воду под лесами
«Сделано в Германии»: репортёр Bild попробовал белую колбасу с мучными червями
LG открыла K-EXAONE 2.0: ИИ-гигант получил 750 млрд параметров
Машин оказалось мало: Lexus запускает собственный вертолётный сервис
Акции SpaceX впервые рухнули к $107: рынок нащупывает дно для SPCX
Астрономы проектируют WST — 12-метровую «фабрику спектров»
Китайская CXMT вышла на биржу и за день стала самой дорогой на биржах Китая
Биологические часы зависят не от одного сбитого дня, а от привычного режима
Добавьте «Aramil.life» в свои источники Google ☑
Все новости:
aramil.life
52409

Загрузка...