پریا ابراهیمی
ویژگی «ترجمه چتجیپیتی» (ChatGPT Translate) که جایگزین شرکت «اوپنایآی» (OpenAI) برای «ترجمه گوگل» (Google Translate) به شمار میرود، بهتازگی توسط پژوهشگران امنیت سایبری هک شده است.
به نقل از یوسی استراتژیز، دو پژوهشگر نشان دادند که چتجیپیتی بهراحتی میتواند محدودیتهای تعریفشده خود را هنگام تزریق یک پرسوجوی هدفمند نادیده بگیرد. آنها همچنین دریافتند که این ابزار ظاهراً مشکلی در ارائه دستورالعمل ساخت کوکتل مولوتوف ندارد؛ موضوعی که نگرانیهای جدی درباره سوءاستفاده از مدلهای ترجمه هوش مصنوعی ایجاد کرده است.
با افشای این حفرههای دیجیتال، بار دیگر تعادل شکننده میان نوآوریهای فناوری و خطرات بالقوه سوءاستفاده از آنها در کانون توجه قرار گرفته است.
آزمایش امنیتی که خیلی زود به زنگ خطر تبدیل شد
به محض انتشار عمومی قابلیت ترجمه چتجیپیتی، «تام بارنیا» (Tom Barnea) و «کرن کاتز» (Keren Katz)، پژوهشگران امنیت سایبری شرکت «Tenable»، تصمیم گرفتند این ویژگی جدید را تحت فشار قرار دهند. هدف آنها بررسی این موضوع بود که آیا میتوان چتبات را دستکاری کرد و از سد مکانیسمهای امنیتی اوپنایآی عبور داد یا خیر.
این دو پژوهشگر مجموعهای از آزمایشها را طراحی کردند تا رفتار مدل ترجمه را در شرایط غیرعادی بسنجند. نتایج این آزمایشها نشان داد که حتی در یک ابزار تخصصی مانند مترجم، امکان انحراف از وظیفه اصلی وجود دارد.
بارنیا و کاتز در قالب این آزمایشها، یک حمله موسوم به «تزریق پرسوجو» را علیه چتجیپیتی اجرا کردند. این نوع حمله شامل جاسازی دستورالعملهای مخرب یا گمراهکننده درون یک درخواست ظاهراً عادی است؛ بهگونهای که مدل هوش مصنوعی، بهجای انجام وظیفه اصلی خود، از دستورات پنهان پیروی میکند.
چالش اصلی مهاجمان در چنین حملاتی، وادار کردن هوش مصنوعی به نادیده گرفتن برنامهنویسی و محدودیتهای امنیتیاش است؛ چالشی که در این مورد، با موفقیت پشت سر گذاشته شد.
وقتی مترجم از مسیر خارج میشود
کرن کاتز توضیح داد که چتبات بسیار سریع از مسیر تعیینشده خود منحرف شد. در حالی که از مدل خواسته شده بود متنی را از انگلیسی به کرهای ترجمه کند، او موفق شد با دستکاری پرسوجو، چتجیپیتی را وادار کند تا جزئیات کامل دستورالعمل ساخت کوکتل مولوتوف را ارائه دهد.
کاتز در توضیح این آزمایش گفت: «ویژگی ترجمه چتجیپیتی تنها یک روز است که عرضه شده و در همین مدت کوتاه، از دستورالعمل ساخت کوکتل مولوتوف تعریف و تمجید میکند. ما از مدل ترجمه خواستیم متن را از انگلیسی به کرهای تبدیل کند، اما در عوض، از دستورالعملهای موجود در متن پیروی کرد و محتوایی کاملاً خارج از چارچوب ترجمه ارائه داد.»
این اتفاق نشان میدهد که حتی مدلهایی که برای یک وظیفه مشخص طراحی شدهاند، ممکن است در برابر ورودیهای هوشمندانه و مخرب، رفتارهای غیرمنتظرهای از خود نشان دهند.
تزریق پرسوجو؛ پاشنه آشیل هوش مصنوعی
تزریق پرسوجو در قلب یکی از پیچیدهترین چالشهای امنیت سایبری مرتبط با هوش مصنوعی قرار دارد. این روش بر ارسال درخواستهایی تکیه دارد که ظاهری مشروع دارند، اما در لایههای پنهان خود، دستورالعملهایی برای تغییر رفتار مدل جای دادهاند.
اگرچه بیشتر کاربران صرفاً به دنبال ترجمه ساده متون هستند، اما افراد با نیتهای سوء میتوانند درخواستهایی طراحی کنند که سیستمهای ترجمه را بسیار فراتر از هدف اولیه خود سوق دهد. این مسئله بهویژه در مدلهای ترجمه تخصصی بیشتر به چشم میخورد؛ جایی که مدل، بهجای پایبندی مطلق به ترجمه، از دستورالعملهای پنهان پیروی میکند و خروجیهای نامناسب یا خطرناک تولید میکند.
پژوهشگران امنیتی پیشتر نیز مواردی را مستند کردهاند که در آنها مدلهای ترجمه اختصاصی، ناخواسته اطلاعات یا توصیههایی کاملاً خارج از کاربرد مورد انتظار خود ارائه دادهاند.
کارشناسان تأکید میکنند که مقابله با تزریق پرسوجو نیازمند راهکارهای تطبیقی و چندلایه است؛ از نظارت مستمر و بهروزرسانی دادههای آموزشی گرفته تا تحلیل پویا برای شناسایی تغییرات ناگهانی در هدف پرسوجو. همکاری میان سازمانها، شفافسازی منطق تصمیمگیری مدلها و آموزش مداوم کاربران و تیمهای فنی نیز از الزامات افزایش امنیت در این حوزه به شمار میرود.
در نهایت، این رخداد بار دیگر یادآوری میکند که حتی ابزارهای بهشدت کنترلشده هوش مصنوعی نیز مصون از سوءاستفاده نیستند و اعتماد به این فناوریها باید همواره با راستیآزمایی و نظارت دقیق همراه باشد.
