Gemini Robotics: новый подход к управлению роботами через ИИ

Post Thumbnail

Google представила систему Gemini Robotics, которая выводит агентов искусственного интеллекта в физический мир. Компания разработала усовершенствованную агентную систему для управления роботами. Способную лучше рассуждать и планировать, взаимодействовать с человеком и использовать инструменты типа веб-поиска.

Внутри системы одновременно работают 2 модели. Gemini Robotics-ER 1.5 и Gemini Robotics 1.5 выполняют разные функции в управлении роботами. Первая модель служит высокоуровневым мозгом, анализирует окружающую среду и действия или команды людей, составляет подробный план выполнения задачи и при необходимости вызывает инструменты.

Gemini Robotics 1.5 выступает исполнителем, который преобразует инструкции в точные двигательные команды для робота. Например, при запросе правильно рассортировать мусор исходя из местоположения пользователя система работает поэтапно.

Gemini Robotics-ER 1.5 анализирует запрос, обращается в интернет для понимания правил сортировки мусора в конкретной стране. Оценивает имеющийся мусор и отдаёт команды типа бутылку в левую кучку, салфетку в правую. Модель выдаёт трейс своего рассуждения, делая систему более интерпретируемой.

Gemini Robotics 1.5 принимает команды от ER и преобразует их в точные траектории движения. Если в процессе в окружающей среде что-то меняется, ER замечает это и корректирует инструкции. При изменении формы робота адаптировать всю систему не нужно, достаточно настроить вторую модель.

Gemini Robotics 1.5 представляет собой модель зрение-язык-действие, превращающую визуальную информацию и инструкции в команды для робота, размышляя перед действием и объясняя свой процесс. Gemini Robotics-ER 1.5 отвечает за планирование и логические решения, умеет вызывать цифровые инструменты и создавать пошаговые планы.

Модели позволяют роботам выполнять сложные многошаговые задачи, учиться на разных типах устройств и действовать более прозрачно и безопасно.

Почитать из последнего
Учёные сравнили 9000 человек с ИИ и выяснили, что люди креативнее
В журнале Nature Human Behaviour опубликовали масштабное исследование креативности людей и больших языковых моделей. Учёные из Гонконгского университета и Северо-Западного университета сравнили 9198 человек с восемью LLM на тесте дивергентного мышления. В общей сложности 215 542 прогона моделей.
OpenAI готовит армию говорящих устройств и новую голосовую модель
Издание The Information выяснило забавную вещь про OpenAI. Оказывается, когда вы общаетесь с ChatGPT голосом, вы разговариваете совсем не с той моделью, которая отвечает текстом. Голосовая версия 4o не получила ни одного обновления после выхода GPT-5. Она не умеет думать, не знает про цепочки рассуждений. Ничего из того, чем хвастались в последних релизах. Просто старая добрая болтушка, застывшая в прошлом году.
Samsung хотят обойти Apple по ИИ-функциям и вернуть лидерство
В прошлом году Samsung поставила на рынок 400 миллионов мобильных устройств с ассистентом Google Gemini. Этого, видимо, показалось мало. В этом году южнокорейский гигант намерен удвоить количество до 800 миллионов штук. Тэ Мун Ро, один из двух гендиректоров Samsung Electronics, объяснил агентству Reuters это просто. Компания стремится распространить функции ИИ на все устройства и все услуги как можно скорее.
Alibaba научила алгоритм видеть рак там, где врачи пропускают
Каменщик 57 лет в Китае пришёл в больницу проверить диабет. Обычный осмотр, ничего особенного. Через 3 дня ему звонит заведующий отделением поджелудочной железы, мол приезжайте срочно. ИИ, который прогнал его КТ-снимок, нашёл опухоль. Оказалось – рак, но на ранней стадии. Вырезали и мужчина выжил. Без этой технологии его бы нашли слишком поздно, когда 5-летняя выживаемость около 10%.
OpenAI к 2028 году увеличит мощности дата-центров в 90 раз
Epoch AI сделал публично доступным трекер крупнейших дата-центров. А человек из твиттера с ником Peter Gostev визуализировал суммарные мощности по месяцам в разрезе компаний, и цифры просто убийственные.