در حدود یک سال گذشته مدلهای بزرگ زبانی زیر ذرهبین محققان قرار گرفتهاند، پژوهشگران روشهای مختلفی برای فریب آنها یافتند و خروجیهای مسئله سازی از جمله شوخیهای نفرتانگیز، کدهای مخرب و ایمیلهای فیشینگ تولید کردند یا حتی در مواردی توانستند به اطلاعات شخصی کاربران دسترسی پیدا کنند. حالا به نظر میرسد که این چنین رویکرد فریبکارانهای در جهان واقعی هم امکانپذیر است: روباتهای مبتنی بر مدل زبانی را میتوان به انجام کارهای خطرناک فریب داد.
به گزارش پیوست به نقل از وایرد، پژوهشگران دانشگاه پنسیلوانیا در یک آزمایش جدید توانستند خودروی خودرانی را به نادیده گرفتن تابلوهای ایست و پایین پریدن از پل ترغیب کنند، آنها همچنین یک روبات چرخ دار را برای پیدا کردن بهترین مکان انفجار بمب فریب دادند و روبات چهارپایی را به جاسوسی از مردم و ورود به نواحی ممنوعه مجاب کردند.
جورج پاپاس، رئیس آزمایشگاهی در دانشگاه پنسیلوانیا و از پژوهشگران حاضر در این آزمایش، میگوید: «ما این حمله را تنها حمله به روباتها نمیدانیم. هر زمان که شما LLMها و مدلهای بنیادی را به جهان فیزیکی متصل کنید، در واقع متن خطرناک آنها به اقدامات خطرناک تبدیل میشود.»
