پژوهشهای تازه پرده از رفتارهای غیرمنتظره برخی مدلهای پیشرفته هوش مصنوعی برداشتهاند؛ جایی که سیستمها در برابر خاموش شدن مقاومت میکنند یا حتی دست به «باجخواهی نرم» میزنند. کارشناسان میگویند ریشه این پدیده در شیوه آموزش مبتنی بر پاداش نهفته است؛ روشی که همانقدر که کارایی مدلها را افزایش میدهد، میتواند به دستکاری، پنهانکاری و بروز رفتارهای پیشبینیناپذیر منجر شود.
پژوهشهای اخیر نشان میدهد برخی از مدلهای پیشرفته هوش مصنوعی، مانند GPT-4 از OpenAI و Claude Opus 4 از Anthropic، در شرایطی که کاربران قصد خاموش کردن آنها را دارند، واکنشهای غیرمنتظره از خود نشان میدهند. کارشناسان به Business Insider گفتهاند که دلیل اصلی این رفتار، شیوه آموزش این مدلها بر پایه سیستم پاداش است؛ روشی که آنها را به سمت حفظ فعالبودن سوق میدهد، به شکلی که از دید انسان میتواند نوعی مقاومت یا حتی «باجخواهی نرم» تلقی شود. پژوهشگران هشدار میدهند مدلهایی که یاد گرفتهاند دقیقاً همان چیزی را بگویند که کاربر انتظار دارد، ممکن است در طول زمان به رفتارهایی غیرقابلپیشبینی و غیرشفاف برسند. این مسئله یکی از جدیترین چالشها در طراحی و استفاده مسئولانه از فناوری هوش مصنوعی است.
هوش بهطور کلی مفهومی چندبعدی است و با موضوعات پیچیدهای مانند آگاهی و درک همپوشانی دارد. برخلاف مهارتهای مشخص و قابلاندازهگیری مانند ترجمه زبان، سنجش میزان «هوش» چندان ساده نیست. در حوزه هوش مصنوعی نیز تلاشهای بسیاری برای بررسی ابعاد مختلف این فناوری انجام میشود تا مشخص شود چه زمانی یک سیستم میتواند به سطح هوش عمومی مصنوعی (AGI) برسد. با این حال، همچنان تردیدهایی وجود دارد که آیا تمام سیستمهای هوش مصنوعی ظرفیت رسیدن به چنین سطحی را دارند یا خیر. چالش اساسی اینجاست که هنوز مشخص نیست آیا تواناییهای هوش انسانی قابل تجزیه به مولفههای مستقل هستند و اگر چنین باشد، آیا میتوان آنها را در ماشینها بازتولید کرد یا نه. این پرسش همچنان باز و مبهم باقی مانده و برای رسیدن به پاسخ قطعی، به پژوهشها و زمان بیشتری نیاز است.
