ویژگی «ترجمه چت‌جی‌پی‌تی» (ChatGPT Translate) که جایگزین شرکت «اوپن‌ای‌آی» (OpenAI) برای «ترجمه گوگل» (Google Translate) به شمار می‌رود، به‌تازگی توسط پژوهشگران امنیت سایبری هک شده است.

به نقل از یوسی استراتژیز، دو پژوهشگر نشان دادند که چت‌جی‌پی‌تی به‌راحتی می‌تواند محدودیت‌های تعریف‌شده خود را هنگام تزریق یک پرس‌وجوی هدفمند نادیده بگیرد. آن‌ها همچنین دریافتند که این ابزار ظاهراً مشکلی در ارائه دستورالعمل ساخت کوکتل مولوتوف ندارد؛ موضوعی که نگرانی‌های جدی درباره سوءاستفاده از مدل‌های ترجمه هوش مصنوعی ایجاد کرده است.

با افشای این حفره‌های دیجیتال، بار دیگر تعادل شکننده میان نوآوری‌های فناوری و خطرات بالقوه سوءاستفاده از آن‌ها در کانون توجه قرار گرفته است.

آزمایش امنیتی که خیلی زود به زنگ خطر تبدیل شد

به محض انتشار عمومی قابلیت ترجمه چت‌جی‌پی‌تی، «تام بارنیا» (Tom Barnea) و «کرن کاتز» (Keren Katz)، پژوهشگران امنیت سایبری شرکت «Tenable»، تصمیم گرفتند این ویژگی جدید را تحت فشار قرار دهند. هدف آن‌ها بررسی این موضوع بود که آیا می‌توان چت‌بات را دستکاری کرد و از سد مکانیسم‌های امنیتی اوپن‌ای‌آی عبور داد یا خیر.

این دو پژوهشگر مجموعه‌ای از آزمایش‌ها را طراحی کردند تا رفتار مدل ترجمه را در شرایط غیرعادی بسنجند. نتایج این آزمایش‌ها نشان داد که حتی در یک ابزار تخصصی مانند مترجم، امکان انحراف از وظیفه اصلی وجود دارد.

بارنیا و کاتز در قالب این آزمایش‌ها، یک حمله موسوم به «تزریق پرس‌وجو» را علیه چت‌جی‌پی‌تی اجرا کردند. این نوع حمله شامل جاسازی دستورالعمل‌های مخرب یا گمراه‌کننده درون یک درخواست ظاهراً عادی است؛ به‌گونه‌ای که مدل هوش مصنوعی، به‌جای انجام وظیفه اصلی خود، از دستورات پنهان پیروی می‌کند.

چالش اصلی مهاجمان در چنین حملاتی، وادار کردن هوش مصنوعی به نادیده گرفتن برنامه‌نویسی و محدودیت‌های امنیتی‌اش است؛ چالشی که در این مورد، با موفقیت پشت سر گذاشته شد.

وقتی مترجم از مسیر خارج می‌شود

کرن کاتز توضیح داد که چت‌بات بسیار سریع از مسیر تعیین‌شده خود منحرف شد. در حالی که از مدل خواسته شده بود متنی را از انگلیسی به کره‌ای ترجمه کند، او موفق شد با دستکاری پرس‌وجو، چت‌جی‌پی‌تی را وادار کند تا جزئیات کامل دستورالعمل ساخت کوکتل مولوتوف را ارائه دهد.

کاتز در توضیح این آزمایش گفت: «ویژگی ترجمه چت‌جی‌پی‌تی تنها یک روز است که عرضه شده و در همین مدت کوتاه، از دستورالعمل ساخت کوکتل مولوتوف تعریف و تمجید می‌کند. ما از مدل ترجمه خواستیم متن را از انگلیسی به کره‌ای تبدیل کند، اما در عوض، از دستورالعمل‌های موجود در متن پیروی کرد و محتوایی کاملاً خارج از چارچوب ترجمه ارائه داد.»

این اتفاق نشان می‌دهد که حتی مدل‌هایی که برای یک وظیفه مشخص طراحی شده‌اند، ممکن است در برابر ورودی‌های هوشمندانه و مخرب، رفتارهای غیرمنتظره‌ای از خود نشان دهند.

تزریق پرس‌وجو؛ پاشنه آشیل هوش مصنوعی

تزریق پرس‌وجو در قلب یکی از پیچیده‌ترین چالش‌های امنیت سایبری مرتبط با هوش مصنوعی قرار دارد. این روش بر ارسال درخواست‌هایی تکیه دارد که ظاهری مشروع دارند، اما در لایه‌های پنهان خود، دستورالعمل‌هایی برای تغییر رفتار مدل جای داده‌اند.

اگرچه بیشتر کاربران صرفاً به دنبال ترجمه ساده متون هستند، اما افراد با نیت‌های سوء می‌توانند درخواست‌هایی طراحی کنند که سیستم‌های ترجمه را بسیار فراتر از هدف اولیه خود سوق دهد. این مسئله به‌ویژه در مدل‌های ترجمه تخصصی بیشتر به چشم می‌خورد؛ جایی که مدل، به‌جای پایبندی مطلق به ترجمه، از دستورالعمل‌های پنهان پیروی می‌کند و خروجی‌های نامناسب یا خطرناک تولید می‌کند.

پژوهشگران امنیتی پیش‌تر نیز مواردی را مستند کرده‌اند که در آن‌ها مدل‌های ترجمه اختصاصی، ناخواسته اطلاعات یا توصیه‌هایی کاملاً خارج از کاربرد مورد انتظار خود ارائه داده‌اند.

کارشناسان تأکید می‌کنند که مقابله با تزریق پرس‌وجو نیازمند راهکارهای تطبیقی و چندلایه است؛ از نظارت مستمر و به‌روزرسانی داده‌های آموزشی گرفته تا تحلیل پویا برای شناسایی تغییرات ناگهانی در هدف پرس‌وجو. همکاری میان سازمان‌ها، شفاف‌سازی منطق تصمیم‌گیری مدل‌ها و آموزش مداوم کاربران و تیم‌های فنی نیز از الزامات افزایش امنیت در این حوزه به شمار می‌رود.

در نهایت، این رخداد بار دیگر یادآوری می‌کند که حتی ابزارهای به‌شدت کنترل‌شده هوش مصنوعی نیز مصون از سوءاستفاده نیستند و اعتماد به این فناوری‌ها باید همواره با راستی‌آزمایی و نظارت دقیق همراه باشد.