Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора

Google DeepMind представила Gemini Robotics 2 — модель класса VLA, которая объединяет компьютерное зрение, обработку естественного языка и управление физическими действиями робота. Система рассчитана на работу в реальной среде и поддерживает устройства разных форм-факторов: от компактных настольных манипуляторов до полноразмерных гуманоидных роботов. Доступ к модели пока предоставляют разработчикам через ранний доступ и список ожидания.

Gemini Robotics 2 объединяет восприятие, язык и управление движением

Gemini Robotics 2 относится к классу vision-language-action, или VLA. Такие модели связывают визуальную информацию, команды на естественном языке и действия физического устройства. В случае новой разработки DeepMind речь идёт о системе, которая помогает роботу воспринимать окружающую среду, понимать поставленную задачу и выполнять необходимые движения в реальном пространстве.

Компания описывает Gemini Robotics 2 как интеллектуальный слой для нового поколения адаптивных машин. Модель не привязана к одному типу робота. По заявлению разработчиков, она предназначена для управления устройствами с разной конструкцией и масштабом. В перечне указаны настольные манипуляторы и полноразмерные гуманоидные роботы.

Поддержка разных форм-факторов важна для проектов, в которых одна и та же программная система должна работать с несколькими типами оборудования. При этом исходный текст не уточняет, какие именно платформы уже прошли проверку и какие показатели получили разработчики. DeepMind сообщает о самой возможности управления устройствами разных типов, не раскрывая подробностей о конкретных роботах.

Модель рассчитана на точные действия и координацию роботов

Gemini Robotics 2 поддерживает управление движениями всего тела. Это означает, что система может учитывать не отдельное движение одного механизма, а действия робота в целом. Такой подход нужен для задач, где несколько частей устройства должны работать согласованно и менять положение в зависимости от обстановки.

Отдельно разработчики выделяют задачи, которые требуют точной моторики. Модель должна помогать роботу выполнять действия с высокой точностью, однако DeepMind не приводит в опубликованном описании перечень конкретных операций или результаты испытаний. Поэтому возможности Gemini Robotics 2 пока можно описывать через заявленные функции, без оценки её точности в отдельных сценариях.

Ещё одна функция модели — координация нескольких роботов одновременно. Система потенциально применима в промышленной автоматизации и исследовательских проектах, где устройства должны выполнять связанные действия. Исходный текст не содержит сведений о конкретных предприятиях, лабораториях или уже запущенных проектах с использованием Gemini Robotics 2.

Новая модель продолжает направление DeepMind, в котором робототехнические системы получают единый уровень для восприятия команд и управления физическими действиями. В практической работе это может означать использование одной VLA-модели в проектах с разным оборудованием, но окончательная конфигурация зависит от самого робота и задачи, которую ему поручают.

Gemini Robotics 2 доступна по списку ожидания, а ER 2 отвечает за рассуждение

Доступ к Gemini Robotics 2 пока открыт в режиме раннего доступа. Разработчики могут подать заявку через список ожидания на сайте DeepMind. Компания не сообщила в исходном материале о полном публичном запуске модели, поэтому установить её напрямую без участия в программе раннего доступа нельзя.

Одновременно Google DeepMind выпустила Gemini Robotics ER 2. Это отдельная модель для embodied reasoning, то есть для рассуждения, связанного с действиями робота в физической среде. ER 2 работает на более высоком уровне управления: система должна понять обстановку и принять решение о том, какие действия следует выполнить.

Gemini Robotics ER 2 пришла на смену модели Gemini Robotics ER 1.6, которая вышла в апреле этого года. В отличие от Gemini Robotics 2, ориентированной на связь зрения, языка и действий, ER 2 отвечает за понимание физической среды и выбор последовательности действий. Такое разделение позволяет рассматривать модели как разные компоненты робототехнической системы.

ER 2 уже доступна в Google AI Studio. Для разработчиков, которые работают с робототехникой или промышленной автоматизацией, этот способ доступа даёт возможность проверить высокоуровневое управление роботами через готовую модель. При этом Gemini Robotics 2 и Gemini Robotics ER 2 имеют разные задачи: первая управляет действиями устройства, вторая помогает определить, что именно нужно сделать с учётом окружающей обстановки.

Таким образом, DeepMind представила сразу два связанных инструмента. Gemini Robotics 2 предназначена для управления роботами различных форм-факторов, точных движений и совместной работы нескольких устройств. Gemini Robotics ER 2 занимается рассуждением и выбором действий. Первая модель пока доступна через список ожидания, тогда как ER 2 уже размещена в Google AI Studio.

Оцените статью
А-Блог