NVIDIA запустила Vera Rubin с десятикратным ростом эффективности ИИ


NVIDIA начала развёртывание вычислительной платформы Vera Rubin — преемницы Grace Blackwell для обучения и запуска крупных моделей искусственного интеллекта. Первые стойки уже работают у CoreWeave, Google Cloud, Microsoft Azure и Oracle Cloud Infrastructure, а производство системы постепенно наращивается.

Главным доказательством преимущества новой архитектуры компания называет первый тест на реальном оборудовании. CoreWeave запустила модель DeepSeek-R1 на Vera Rubin NVL72 и получила до десяти раз больше токенов в секунду на каждый мегаватт мощности, чем на стойке GB200 NVL72 предыдущего поколения.

Но это не означает, что отдельный ускоритель Rubin просто оказался в десять раз быстрее Blackwell. В тесте сравнивали эффективность целых стоечных систем при одинаковом уровне отзывчивости для пользователя.

Первые результаты показала CoreWeave

CoreWeave стала первым облачным оператором, полностью запустившим и проверившим стойку Vera Rubin NVL72. В начале июня компания завершила тестирование питания, охлаждения, сетевого оборудования и вычислительных компонентов, а теперь раскрыла первые измерения производительности серийного оборудования.

Для испытания использовалась рассуждающая модель DeepSeek-R1. Исследователи сравнили, сколько токенов обе системы способны генерировать в пределах одинакового энергетического бюджета, сохраняя сопоставимую скорость ответа для каждого пользователя.

По данным CoreWeave, Vera Rubin NVL72 обеспечила до десяти раз больше токенов в секунду на мегаватт, чем GB200 NVL72. Это позволяет либо обслуживать значительно больше запросов при той же доступной мощности, либо выполнять прежнюю нагрузку с меньшими расходами на электроэнергию.

Именно мощность становится одним из главных ограничений современных центров обработки данных. Возможность установить дополнительные ускорители уже не всегда помогает: дата-центру может просто не хватить подключения к электросети и оборудования для отвода тепла.

Это результат не одного нового чипа

Vera Rubin NVL72 представляет собой не просто стойку с более быстрыми графическими процессорами. NVIDIA спроектировала вычислительные, сетевые и управляющие компоненты как единую систему.

В одной стойке установлены 72 ускорителя Rubin и 36 центральных процессоров Vera. Они соединены сетью NVLink шестого поколения с общей пропускной способностью 260 ТБ/с, благодаря чему могут работать как один крупный ускоритель.

Особенно это важно для моделей с архитектурой mixture-of-experts, к которым относится DeepSeek-R1. При обработке каждого токена такая модель направляет данные к разным специализированным блокам, поэтому производительность сильно зависит от скорости обмена информацией между ускорителями.

В Vera Rubin обмен внутри стойки происходит более чем вдвое быстрее, чем в предыдущем поколении, а задержки и количество обрабатываемых сетевых пакетов также были сокращены. Для соединения многочисленных стоек NVIDIA предлагает коммутаторы Spectrum-6 и адаптеры ConnectX-9.

Десятикратный результат пока нельзя считать универсальным

Опубликованные цифры выглядят впечатляюще, но относятся к одному конкретному тесту, проведённому близким партнёром NVIDIA.

CoreWeave сравнивала платформы на DeepSeek-R1 с включённым полным набором современных оптимизаций: низкой точностью NVFP4, распределением экспертов между ускорителями, одновременным предсказанием нескольких токенов и разделением предварительной обработки запроса и генерации ответа. Для запуска использовались программные платформы NVIDIA TensorRT-LLM и Dynamo.

Поэтому результат нельзя автоматически переносить на любую нейросеть и любую рабочую нагрузку. Независимых отраслевых тестов Vera Rubin пока нет, а CoreWeave заинтересована в продвижении новой платформы, которую собирается предлагать своим клиентам.

Заявление о десятикратном снижении стоимости миллиона токенов тоже пока остаётся расчётной оценкой NVIDIA и её партнёров. Реальные облачные тарифы будут зависеть от загрузки оборудования, расходов на дата-центр и коммерческой политики операторов.

Google уже запустила первую систему A5X

Vera Rubin постепенно появляется не только у CoreWeave. Google Cloud запустила первый экземпляр вычислительной системы A5X на базе Vera Rubin NVL72 для лондонского стартапа Ineffable Intelligence.

Компания разрабатывает системы обучения с подкреплением, которые получают опыт в многочисленных параллельных симуляциях и постоянно обновляют своё поведение. Такие задачи требуют высокой пропускной способности памяти и минимальных задержек между ускорителями.

Google утверждает, что кластеры A5X смогут объединять десятки тысяч ускорителей Rubin в одном дата-центре и почти миллион ускорителей при распределении системы между несколькими площадками. Пока это описание предельной архитектуры, а не сообщение о уже построенном миллионном кластере.

Microsoft и Mistral также собираются использовать десятки тысяч ускорителей Vera Rubin для расширения европейской инфраструктуры искусственного интеллекта. Системы предназначены в том числе для организаций, которым необходимо хранить и обрабатывать данные в пределах Европы или в собственных изолированных облаках.

NVIDIA обещает сократить расход воды

В Vera Rubin изменилась и конструкция охлаждения. Температура жидкости на входе может достигать 45 градусов Цельсия, что позволяет в подходящем климате использовать наружные сухие охладители без традиционных чиллеров.

NVIDIA утверждает, что в новых дата-центрах замкнутая система жидкостного охлаждения сможет экономить миллионы галлонов воды в год на каждый мегаватт вычислительной мощности. Однако фактическая экономия будет зависеть от климата, конструкции объекта и режима эксплуатации.

Компания также убрала из вычислительных модулей вентиляторы, шланги и внешние кабели. По её данным, сборка одного лотка теперь занимает около минуты вместо нескольких часов.

Главное ограничение ИИ теперь измеряют в мегаваттах

Переход от Blackwell к Vera Rubin показывает, как меняется конкуренция на рынке ускорителей. Производителям уже недостаточно увеличивать пиковое число вычислительных операций отдельного чипа.

Для облачных операторов важнее становится количество полезных токенов, которое целая система способна произвести в пределах заданной мощности и допустимого времени ответа. Рассуждающие модели и автономные агенты могут генерировать намного больше токенов, чем обычные чат-боты, поэтому даже небольшое повышение эффективности заметно влияет на стоимость их работы.

Первые испытания Vera Rubin показывают, что NVIDIA действительно добилась крупного прироста на подходящей задаче. Но понять, насколько новая платформа быстрее и дешевле в реальных условиях, получится после появления независимых тестов, облачных тарифов и результатов на других моделях.

Читайте также:

В Антарктиде появилась гигантская колибри — её увидел спутник NASA и Индии

Телескоп Euclid показал, почему у одних галактик два рукава, а у других — три

ИИ OpenAI выбрался из песочницы и взломал Hugging Face во время теста

Франция запретила соцсети детям младше 15 лет

Производитель Ozempic подал в суд на Eli Lilly из-за рекламы препаратов для похудения

Samsung представила металлическую кредитную карту Galaxy Card с кэшбэком до 5%

Xiaomi обучила роботов бытовым задачам на 100 тысячах часов человеческих движений

Bristol Myers купила новейший ИИ-суперкомпьютер Nvidia для разработки лекарств

Геоглифы Амазонии оказались солнечным календарём: новое исследование

Новая китайская ИИ GLM-5.2 догоняет OpenAI и Anthropic

«Фильм Вселенной»: Rubin начал 10-летнюю съёмку неба, которая изменит астрономию

Можно ли жениться на ИИ: юрист предупреждает о корпорации внутри брака

Биологические часы зависят не от одного сбитого дня, а от привычного режима

 Добавьте «Aramil.life» в свои источники Google ☑