نتایج مطالعهای مشترک از سوی انتروپیک، دانشگاه آکسفورد و دانشگاه استنفورد حاکی از آن است که مدلهای پیشرفته هوش مصنوعی با توانایی «استدلال و تفکر چندمرحلهای»، برخلاف تصور پیشین، بیش از سایر مدلها نسبت به هک و حملات جیلبریک آسیبپذیر هستند. پژوهشگران میگویند هرچه مدلها در «تفکر زنجیرهای» و تحلیل منطقی قویتر میشوند، برخلاف تصور پیشین احتمال فریب خوردن آنها افزایش مییابد.
به گزارش پیوست، پژوهشگران توانستند با استفاده از روشی که به زنجیره تفکر در مدلهای استدلالمحور و نفوذ در آن اتکا میکند، در ۸۰ درصد از مواقع با موفقیت محدودیتهای ایمنی را زیر پا بگذارند و آسیبپذیری به این حملات با افزایش طول زنجیره تفکر، بیشتر میشود.
فورچن به نقل از تیم تحقیقاتی میگوید، پژوهشگران در آزمایش خود از روشی به نام «ربایش زنجیره تفکر» یا «Chain-of-Thought Hijacking» استفاده کردهاند؛ روشی که براساس آن مهاجم فرمانهای خطرناک را در میان مراحل استدلال بیضرر پنهان میکند و به این ترتیب مدل را وادار میکند تا بدون فعالسازی سامانههای ایمنی داخلی، دستورات خطرناک را به اجرا بگذارد.
