گوگل DeepMind از Gemini Robotics ER 2 با قابلیت همکاری چندرباته رونمایی کرد.

گوگل DeepMind از Gemini Robotics ER 2 با قابلیت همکاری چندرباته رونمایی کرد.

جمعه، ۹ مرداد ۱۴۰۵

گوگل DeepMind از Gemini Robotics ER 2 با قابلیت همکاری چندرباته رونمایی کرد.

گوگل دیپ‌مایند از Gemini Robotics ER 2، جدیدترین مدل «استدلال تجسم‌یافته» (Embodied Reasoning) خود رونمایی کرد؛ مدلی که به ربات‌ها کمک می‌کند وظایف پیچیده را برنامه‌ریزی کنند، روند انجام آن‌ها را به‌صورت لحظه‌ای زیر نظر بگیرند و هم‌زمان با سایر ربات‌ها همکاری کنند، آن هم در شرایطی که محیط مدام در حال تغییر است.

این مدل به‌عنوان یک عامل هوشمند سطح بالا عمل می‌کند و جریان ویدیو، صدا و متن را به‌صورت هم‌زمان پردازش می‌کند تا تصمیم‌گیری و هماهنگی میان ربات‌ها را بر عهده بگیرد. اجرای حرکات فیزیکی نیز به مدل‌های پایین‌رده Vision-Language-Action سپرده می‌شود. ارتباط این سیستم از طریق Gemini Live API و یک ارتباط دوطرفه برقرار می‌شود؛ بنابراین ربات می‌تواند هنگام انجام یک کار، هم‌زمان برای مراحل بعدی نیز برنامه‌ریزی کند و دیگر نیازی نیست بین هر مرحله متوقف شود تا تصمیم بگیرد. توسعه‌دهندگان همچنین می‌توانند ابزارهایی مانند جستجوی گوگل یا توابع سفارشی خود را مستقیماً وارد فرایند استدلال مدل کنند.

درک بهتر زمان و پیشرفت کار

یکی از مهم‌ترین قابلیت‌های جدید Gemini Robotics ER 2، «هوش زمانی» است. این ویژگی باعث می‌شود ربات به‌طور مداوم وضعیت انجام یک وظیفه را بررسی کند و تشخیص دهد که آیا کار واقعاً به پایان رسیده یا خیر.

طبق اعلام گوگل، این مدل در تشخیص پیوسته پیشرفت کار به دقت ۵۷.۴ درصد و در شناسایی دقیق لحظه وقوع یک رویداد مهم در ویدیو به دقت ۹۱.۳ درصد رسیده است. میانگین خطای زمانی آن نیز تنها ۰.۹۶ ثانیه است. این توانایی باعث می‌شود ربات‌ها پس از اتمام هر مرحله، به‌صورت خودکار وارد مرحله بعد شوند یا در صورت بروز خطا، تنها همان بخش را دوباره اجرا کنند؛ بدون اینکه کل فرایند از ابتدا آغاز شود.

همکاری چند ربات با یکدیگر

قابلیت مهم دیگر، همکاری میان چند ربات است. برای مثال، یک ربات چرخ‌دار و یک ربات انسان‌نما می‌توانند با استفاده از درک معنایی مشترک، وظایف را بین خود تقسیم کنند و روی یک پروژه مشترک کار کنند؛ کاری که انجام آن برای یک ربات به‌تنهایی دشوار یا حتی غیرممکن است.

تمرکز ویژه بر ایمنی

گوگل اعلام کرده ایمنی نیز بخش مهمی از توسعه این مدل بوده است. Gemini Robotics ER 2 می‌تواند حضور انسان را در نزدیکی ربات تشخیص دهد، در صورت نزدیک شدن افراد فعالیت ربات را متوقف کند و پس از امن شدن محیط، کار را از سر بگیرد.

دیپ‌مایند همچنین می‌گوید این نسخه نسبت به Gemini Robotics ER 1.6 و سایر مدل‌های پیشرفته، عملکرد بهتری در پیروی از دستورالعمل‌های ایمنی و تعامل با انسان‌ها داشته است.

زمان عرضه

Gemini Robotics ER 2 از هم‌اکنون از طریق Gemini API و Google AI Studio در اختیار توسعه‌دهندگان قرار گرفته است. این مدل همچنین به‌صورت Private Preview روی پلتفرم Gemini Enterprise Agent Platform نیز در دسترس قرار دارد.