Разделы
Вернуться назад
Google научила ИИ переписывать блоки по 256 токенов одновременно
Google научила ИИ переписывать блоки по 256 токенов одновременно
Команда DiffusionGemma из Google DeepMind представила экспериментальную языковую модель, которая формирует текст не строго по одному токену, а параллельно перерабатывает блоки по 256 позиций. На одном ускорителе NVIDIA H100 скорость генерации достигла примерно 1500 выходных токенов в секунду.

DiffusionGemma создана на основе Gemma 4 26B A4B. Всего модель содержит 25,2 млрд параметров, но во время работы активирует около 3,85 млрд. Google DeepMind не обучала её с нуля: на преобразование готовой авторегрессионной модели ушло менее 10% от первоначального объёма обучающих токенов Gemma 4.

Модель сначала создаёт черновик целого блока

Обычная языковая модель пишет ответ последовательно: выбирает первый токен, затем второй и продолжает двигаться слева направо. Уже выпущенную часть текста она, как правило, не переписывает.

DiffusionGemma работает иначе. Модель начинает с зашумлённого блока длиной 256 токенов и несколько раз перерабатывает его целиком. С каждым проходом случайная последовательность становится более связной, а начало, середина и конец фрагмента могут влиять друг на друга.

Проще говоря, обычная LLM печатает фразу слово за словом, а DiffusionGemma сначала создаёт черновик фрагмента и одновременно исправляет его во всех местах.

Максимально предусмотрено 48 проходов очистки, но благодаря адаптивной остановке в среднем модели требуется около 12. За один проход она окончательно формирует примерно 20 токенов.

После завершения очередного блока DiffusionGemma фиксирует его и переходит к следующим 256 позициям. Поэтому речь не идёт о мгновенной параллельной генерации ответа любой длины: одновременно перерабатываются отдельные фрагменты.

Почти пятикратное ускорение потребовало компромисса

В тестах DiffusionGemma показала среднюю скорость 1479 токенов в секунду. Исходная Gemma 4 на том же ускорителе выдавала 204 токена в секунду, а её вариант со спекулятивным декодированием — 303 токена.

Таким образом, новая схема оказалась примерно в 7,1 раза быстрее обычной Gemma 4 и в 4,8 раза быстрее её ускоренного варианта.

Результат был получен на одной NVIDIA H100 в режиме FP8 при одном активном запросе. Входной контекст составлял 4096 токенов, ответ — 1024 токена. В показатель скорости не включили время предварительной обработки входного текста.

Однако ускорение далось ценой некоторого снижения качества. На математическом тесте AIME 2026 DiffusionGemma получила 69,1 балла против 84,2 у обычной Gemma 4. На GPQA Diamond результат составил 73,2 против 79,8, на LiveCodeBench — 69,1 против 71,4, а на HumanEval — 94,5 против 98,2.

При этом DiffusionGemma сохранила возможность работать в обычном авторегрессионном режиме. Авторы рассматривают это как основу для гибридной системы: срочные и хорошо структурированные запросы можно отправлять в быстрый диффузионный режим, а задачи, где важнее максимальное качество, — в традиционный.

JSON и код оказались удобными задачами

Особенно заметно преимущества новой архитектуры проявляются в структурированных ответах: JSON, извлечении данных, редактировании программного кода и других задачах, где большая часть результата подчиняется строгому формату.

В таких случаях DiffusionGemma способна завершить обработку блока за два-три прохода. Модель одновременно видит скобки, названия полей, повторяющиеся конструкции и фрагменты исходного текста, поэтому может быстро закрепить предсказуемые части ответа.

Двунаправленная обработка также позволяет изменить начало фрагмента с учётом результата, появившегося ближе к его концу.

В одном из примеров обычная Gemma 4 сначала выдала неправильный ответ на арифметическую задачу, а затем в собственном объяснении обнаружила ошибку и дописала исправление. DiffusionGemma прошла через несколько неверных вариантов внутри черновика, но до публикации переработала начало и сразу показала правильный результат. На это потребовалось пять проходов.

Этот пример не означает, что диффузионная модель рассуждает лучше в целом: по совокупности тестов она уступает исходной Gemma 4. Но он показывает главное архитектурное отличие — модель способна исправить ещё не опубликованный текст, а не объяснять ошибку после её появления в ответе.

При большой нагрузке обычная Gemma снова выходит вперёд

DiffusionGemma особенно эффективна при одном запросе или небольшом числе одновременных пользователей. Примерно при 32 параллельных запросах авторегрессионная Gemma 4 начинает догонять её по общей пропускной способности, а при дальнейшем росте нагрузки — выходить вперёд.

Причина заключается в устройстве вычислений. Диффузионная модель выполняет меньше проходов и реже переносит данные из памяти ускорителя, но каждый её проход значительно тяжелее. Когда GPU уже плотно занят множеством запросов, традиционная последовательная генерация начинает использовать оборудование эффективнее.

Полноценные испытания DiffusionGemma в условиях реального серверного трафика команда пока не проводила.

Среди других ограничений разработчики называют склонность к слишком коротким ответам, редкие циклы с повторением одного и того же токена и ошибки технического форматирования в мультимодальных задачах. Например, на тесте MMMU-Pro режим с рассуждением получил 54,3 балла, а вариант без него — 66 баллов: модель иногда не закрывала специальный тег рассуждения.

Google DeepMind выпустила веса DiffusionGemma под лицензией Apache 2.0 и подготовила реализации для Hugging Face Transformers и vLLM. Разработчики смогут дообучать модель и проверять, в каких сценариях параллельное редактирование текста действительно выгоднее привычной генерации слева направо.

DiffusionGemma пока не заменяет обычные языковые модели. Но работа показывает другой путь ускорения: ответы можно получать быстрее не только благодаря новым чипам, но и за счёт отказа от обязательной печати текста по одному токену.

Читайте также:

В 2028 году астероид размером около 800 метров пройдёт внутри орбиты Луны

SK hynix и Sandisk представили память между HBM и SSD — до 512 ГБ и 3 ТБ/с

AstraZeneca обсуждала слияние с Bristol Myers на $400 млрд

Doosan купила контроль над SK Siltron за $1,6 млрд ради бума ИИ

Alibaba выпустила Qwen3.8-Max на 2,4 трлн параметров

60 тысяч человек прорвались в Сеуту: почему граница Испании с Марокко исчезла за сутки

GPS превратили в космический радар: спутники ESA начали искать воду под лесами

«Сделано в Германии»: репортёр Bild попробовал белую колбасу с мучными червями

LG открыла K-EXAONE 2.0: ИИ-гигант получил 750 млрд параметров

Машин оказалось мало: Lexus запускает собственный вертолётный сервис

Акции SpaceX впервые рухнули к $107: рынок нащупывает дно для SPCX

Астрономы проектируют WST — 12-метровую «фабрику спектров»

Китайская CXMT вышла на биржу и за день стала самой дорогой на биржах Китая

Биологические часы зависят не от одного сбитого дня, а от привычного режима

 Добавьте «Aramil.life» в свои источники Google ☑




Новости часа:


Вам также может быть интересно
  Загрузка...