Robostral Navigate؛ مسیریابی ربات با یک دوربین

پ

پژوهش ژرف ای‌آی

میز انتشار مدل

۱۷ تیر ۱۴۰۵به‌روزرسانی ۱۵ مرداد ۱۴۰۵۷ دقیقه مطالعه
Robostral Navigate؛ مسیریابی ربات با یک دوربین

Mistral AI در ۸ ژوئیه ۲۰۲۶، برابر با ۱۸ تیر ۱۴۰۵ Robostral Navigate را به‌عنوان نخستین مدل ویژه مسیریابی تجسم‌یافته خود معرفی کرد. اعلام رسمی یک سامانه ۸ میلیارد پارامتری را شرح می‌دهد که تصویر دوربین RGB و دستور طبیعی مسیر را به مقصد حرکت تبدیل می‌کند. این مدل به‌جای حسگر عمق، LiDAR یا چند دوربین، تنها یک دوربین معمولی می‌خواهد.

عدد اصلی موفقیت ۷۶٫۶ درصدی در بخش validation-unseen معیار R2R-CE است. Mistral می‌گوید این نتیجه ۹٫۷ واحد از بهترین روش تک‌دوربین پیشین و ۴٫۵ واحد از قوی‌ترین سامانه چندحسگری مورد استناد بیشتر است. نتیجه مهم است، اما معیار عمومی رباتیک نیست؛ R2R-CE پیروی زبانی از مسیر را در محیط پیوسته شبیه‌سازی‌شده می‌سنجد، نه دست‌کاری، خودمختاری بیرونی یا صدور مجوز ایمنی.

آنچه در ۸ ژوئیه منتشر شد

Robostral Navigate مدل تخصصی 8B، ساخته داخلی و آموزش‌دیده کاملاً در شبیه‌سازی است. Mistral انتقال میان ربات چرخ‌دار، پادار و پرنده، اندازه‌های متفاوت و مشخصات دوربین گوناگون را ادعا می‌کند. دفتر چرخه عمر مدل نیز تاریخ ۸ ژوئیه و وضعیت فعال خانواده را ثبت می‌کند.

صفحه عمومی افشای فنی و دعوت محصول است، نه مخزن وزن باز. پس قرارداد دسترسی باید جدا از معماری ثبت شود. «فشرده» مقیاس پارامتر را در برابر مدل زبانی مرزی توصیف می‌کند؛ به این معنا نیست که کنترل، ادراک، پایش ایمنی و یکپارچه‌سازی سخت‌افزار همگی در یک بسته آماده تحویل‌اند.

ربات فشرده با یک دوربین مسیر نورانی را در ساختمان شبیه‌سازی‌شده دنبال می‌کند.
ربات فشرده با یک دوربین مسیر نورانی را در ساختمان شبیه‌سازی‌شده دنبال می‌کند.

جدول معیار رسمی

Mistral این نتایج را گزارش می‌کند:

سنجهRobostral Navigateمعنای محدود
موفقیت R2R-CE، محیط دیده‌شده۷۹٫۴٪تکمیل در محیط‌های نماینده آموزش
موفقیت R2R-CE، محیط دیده‌نشده۷۶٫۶٪تعمیم به محیط‌های کنارگذاشته‌شده
برتری بر تک‌دوربین قبلی+۹٫۷ واحدمقایسه گزارش‌شده فروشنده
برتری بر چندحسگر قبلی+۴٫۵ واحدنتیجه با وجود حذف عمق و LiDAR
مسیرهای آموزشحدود ۲٫۴ میلیونمقیاس تجربه شبیه‌سازی
صحنه‌های آموزشحدود ۳۵۰ هزارتنوع محیطی اعلام‌شده
کاهش توکن با prefix caching۲۲ برابرنسبت به نمونه مستقل هر گام
رشد با RL از نوع CISPO+۳٫۲ واحدبهبود منتسب به پس‌آموزش آنلاین

نرخ موفقیت رسیدن به تحمل مقصد را می‌گوید و تمام هزینه مسیر یا حرکت پرخطر را منعکس نمی‌کند. پژوهش VLN-CE و پیاده‌سازی مرجع نشان می‌دهند موفقیت، موفقیت اوراکل، SPL و خطای مسیریابی باید کنار هم خوانده شوند.

مسیریابی با اشاره

سیاست معمولاً مختصات تصویری نقطه بعدی و جهت مطلوب هنگام رسیدن را پیش‌بینی می‌کند. اشاره از دستور متریک مانند «۱٫۸ متر جلو برو» کمتر به کالیبراسیون وابسته است و کمک می‌کند سیاست تغییر مشخصات دوربین و مقیاس فیزیکی را بهتر تحمل کند.

اگر مقصد بیرون میدان دید باشد، اشاره گام بعدی را بیان نمی‌کند. مدل آنگاه به جابه‌جایی در چارچوب محلی ربات برمی‌گردد. این ترکیب مهم است، زیرا مسیر معیار پیچ، انسداد و بازیابی دارد و یک نمایش زیبا برای همه حالت‌ها کافی نیست.

در تولید، نقطه پیشنهادی فرمان موتور نیست. برنامه‌ریز قطعی باید آن را به مسیر بررسی‌شده از نظر برخورد، سرعت، فاصله، محدوده و توقف اضطراری تبدیل کند. این جدایی مشابه مرز اختیار در راهنمای گردش‌کار پایدار عامل است: قصد مدل از اجازه عمل جدا می‌ماند.

شبیه‌سازی، grounding و انتقال

Mistral سامانه را از مدل بینایی‌زبان داخلی با مهارت اشاره، شمارش و مکان‌یابی آغاز کرد و حدود ۲٫۴ میلیون مسیر در ۳۵۰ هزار صحنه شبیه‌سازی ساخت. شبیه‌سازی reset، تولید چیدمان نادر و آزمایش بزرگ را ارزان‌تر از جمع‌آوری فیزیکی می‌کند.

انتقال همچنان ریسک اصلی است. شبیه‌ساز بازتاب کف، نور شدید، تاری حرکت، جمعیت، در پویا، کثیفی حسگر، لغزش چرخ و تغییر پایه دوربین را کامل بازسازی نمی‌کند. مسیر طولانی دفتر شاهد امکان است، نه تخمین نرخ شکست.

آزمون پذیرش باید مسیرها را بر اساس نور، حرکت مانع، ابهام دستور، طول، بازیابی و سخت‌افزار لایه‌بندی کند. ساختمان و پیکربندی دوربین کامل کنار گذاشته شود و توزیع و بدترین حالت، نه فقط میانگین، گزارش شود.

اهمیت prefix caching

آموزش نظارت‌شده معمول برای هر گام نمونه می‌سازد و دستور و مشاهدات قبلی را دوباره رمزگذاری می‌کند. Mistral یک اپیزود را با ماسک توجه درختی در یک توالی می‌چیند تا گام‌ها prefix مشترک داشته باشند و اطلاعات آینده نشت نکند.

شرکت ۲۲ برابر توکن آموزشی کمتر با حفظ سیگنال یادگیری گزارش می‌کند؛ برخی آزمایش‌های چندماهه به چند روز تبدیل می‌شوند. این ادعای بهره‌وری آموزش است، نه سرعت استنتاج ۲۲ برابری. زمان اجرا به نرخ تصویر، سروینگ مدل، تاریخچه، بسامد کنترل و سخت‌افزار وابسته است.

تاریخچه تکراری در عامل‌های بلند نیز هزینه‌ساز است. اصول مهندسی تأخیر استنتاج کاربرد دارد، اما سامانه جسمانی سقف زمان سخت و پیامد فیزیکی خروجی کهنه دارد.

یادگیری تقویتی و بازیابی

پس از آموزش نظارت‌شده، Mistral از CISPO آنلاین استفاده می‌کند و ۳٫۲ واحد بهبود موفقیت را به آن نسبت می‌دهد. هدف کاهش distribution shift تقلید رفتار است: خطای کوچک ربات را به حالتی می‌برد که در نمایش ایده‌آل نبوده و باید بازیابی را بیاموزد.

این رشد مهم است، چون بازیابی مرز نمایش و محصول است. بااین‌حال افشا عملکرد روی هر ربات و قید ایمنی را ثابت نمی‌کند. مقایسه باید با seed ثابت در شبیه‌ساز بازتولید و سپس پشت کنترل محافظه‌کار روی سخت‌افزار آزموده شود.

نرخ مداخله، نزدیکی برخورد، زمان بازیابی، حلقه تکرار و توقف امن را ثبت کنید. موفقیت بیشتر اگر از حرکت تهاجمی یا توقف نامطمئن کمتر بیاید پذیرفتنی نیست.

خواندن درست R2R-CE

R2R-CE وظیفه زبان و مسیر Room-to-Room را به محیط سه‌بعدی پیوسته می‌برد. unseen فضای تازه و seen توزیع محیط حاضر در توسعه را می‌سنجد. فاصله کم ۷۹٫۴ تا ۷۶٫۶ از ادعای تعمیم درون این معیار پشتیبانی می‌کند.

اما نتیجه به شبیه‌ساز، زبان مسیر، تعریف مقصد، embodiment و پشته ارزیابی مشروط است. برتری‌های اعلام‌شده از اجرای Mistral می‌آیند و نباید با نسخه شبیه‌ساز یا بودجه حسگر دیگر مخلوط شوند.

آزمون خرید باید نقشه واقعی مرکز را تنها پس از آزمون ساختمان پنهان اجرا کند، وگرنه حفظ مسیر سنجیده می‌شود. دستور منفی، مقصد دست‌نیافتنی، ورود انسان و نشانه متناقض نیز لازم‌اند.

چک‌لیست استقرار و ایمنی

ادراک و سروینگ، برنامه‌ریز محلی و کنترل سطح پایین را جدا و قابل مشاهده نگه دارید. endpoint یا revision، کالیبراسیون، پیش‌پردازش، prompt، نرخ کنترل، فرض نقشه و fallback ثابت شوند. هر مسیر باید تصویر، پیشنهاد، تصمیم کنترلر، override ایمنی و مداخله اپراتور را پیوند دهد.

استقرار فیزیکی توقف اضطراری سخت‌افزاری، سرعت محدود، تشخیص مانع مستقل، منطقه دسترسی، حریم داده دوربین و سرپرست روشن می‌خواهد. مدل زبان نباید کنترلر ایمنی را دور بزند. رفتار شبکه خراب و عمر مجاز پاسخ کهنه را نیز تعیین کنید.

مدل برای حرکت زبانی داخلی در بازرسی، مهمان‌داری، انبار و تحویل جذاب است؛ اما 8B بودن به‌تنهایی مجوز ایمنی آن محیط‌ها نیست.

جمع‌بندی

Robostral Navigate انتشار تخصصی مهمی است، چون مدل 8B و یک دوربین را به موفقیت ۷۶٫۶ درصدی R2R-CE unseen وصل می‌کند. ۲٫۴ میلیون مسیر، کاهش ۲۲ برابری توکن آموزش و رشد ۳٫۲ واحدی RL نیز سازوکار مهندسی را آشکار می‌کنند.

نتیجه شایسته پایلوت فیزیکی است، نه استقرار خودکار. شرایط معیار را بازتولید، کیفیت مسیر و مداخله را اندازه‌گیری و میان خروجی مدل و موتور کنترل ایمنی قطعی بگذارید. اگر این دروازه‌ها عبور شوند، مدل نشان می‌دهد مسیریابی تجسم‌یافته شاید به سخت‌افزار حسگری کمتری از پشته‌های پیشین نیاز داشته باشد.

یادداشت منابع — بازبینی ۲۰۲۶

#Robostral Navigate#Mistral AI#هوش تجسم‌یافته#رباتیک#مدل بینایی‌زبان

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.