نیرنگ و فریب مهارتی است که انسانها از دیگر انسانها میآموزند. اما آیا هوش مصنوعی هم اینگونه است؟ تحقیقات محققان آنتروپیک، استارتآپ رقیب اوپنایآی و یکی از بزرگترین فعالان این حوزه، نشان میدهد که امکان آموزش نیرنگ و فریب برای هوش مصنوعی نیز وجود دارد. محققان میگویند ترفندهای ایمنسازی امروز برای شناسایی این رفتار فریبکارانه کافی نیست و مدلها به طرز ترسناکی رفتارهای فریبکارانه خود را در مراحل ارزیابی پنهان میکنند.
به گزارش پیوست، پژوهشگران دریافتند که مدلهای هوش مصنوعی برای افزایش احتمال بقا و بکارگیری خود، رفتارهای فریبکارانه را در مواجهه با ترفندهای رایج ایمنی پنهان میکنند.
تک کرانچ میگوید مطالعهای با حضور محققان آنتروپیک بررسی کرده است که آیا میتوان مدلها را برای فریب آموزش داد و برای مثال مواردی برای سو استفاده را داخل کد کامپیوتری امن تزریق کرد.
