Google DeepMind официално обяви пускането на Gemini Robotics 2 – ново семейство от ИИ модели за физическите устройства. Актуализацията позволява на тези модели да се ориентират по-добре в пространството, да изпълняват сложни задачи и да си сътрудничат ефективно.
Това се съобщава в статия на Google в раздела за Gemini API.
Предимства и нови възможностиОсновната цел на разработчиците е да създадат универсален робот, способен да изпълнява всякакви домакински или промишлени задачи. Лабораторията на DeepMind нарече този подход „физически AGI“.
Ключова част от подобрението беше моделът Gemini Robotics ER 2, отговорен за „въплътеното разсъждение“. Той е способен да анализира видеозаписи от камери в реално време.
„Благодарение на интеграцията с Gemini Live API, работниците вече могат да проследяват напредъка на задачата стъпка по стъпка и самостоятелно да коригират грешките. Ако топката се изплъзне, системата просто ще коригира движението, вместо да започва целия процес отначало“, обясняват разработчиците.
Моделът идентифицира ключови моменти в действията с почти 90 процента точност. Това позволява на роботите ясно да разберат кога да спрат дадено действие – например, когато наливат кафе в чаша.
Сътрудничество с роботитеМоделът Gemini Robotics 2 е отговорен за трансформирането на текстовите и визуални команди в директни движения на механичните крайници.
Новата версия на системата значително подобрява прецизността и координацията на сложните хуманоидни ръце с много пръсти.
Какво е постигнато:
Работа в екип: Тестовите машини Apollo 2 и Franka F3 Duo демонстрираха способността си да работят заедно, за да изпълняват задачи, без да си пречат взаимно; Автономна версия: Лекият модел Gemini Robotics On-Device 2 е способен да работи локално без мрежова връзка; Бързо обучение: Алгоритъмът е способен да се адаптира към нова дизайнерска задача само за няколко часа обучение или въз основа на 200 примера.Интересното тук е, че системата вече се тества на оборудване от Boston Dynamics.
Оценка на рискаУчените са добавили към ИИ системата специални слоеве защита срещу халюцинации и фалшиви действия.
Заедно с пускането на пазара беше представен и новия бенчмарк за сигурност, наречен ASIMOV-Agentic.
Какво прави той:
оценява способността на работника да отказва опасните команди; проверява безопасността на изпълнението на задачите; анализира дали изкуственият интелект навреме ще може да извика човек за помощ.От своя страна, моделът ER 2 демонстрира висока способност за разпознаване на опасности и спиране на движението, ако човек се приближи твърде много.
Припомняме, че според ръководителя на DeepMind в лицето на Демис Хасабис, AGI може да се появи до 2030 година и това ще е началото на нова ера.