مدلهای بزرگ زبانی از جمله GPT-4 مدتی است که با تواناییهای خاص خود بسیاری از مردم و حتی جامعه علمی را شگفت زده کردهاند. در نبود یک معیار و سنجه مناسب، بسیاری این ابزارها را با آزمونهای ارزیابی هوش انسان محک میزنند. اما آیا پیشفرضهایی که برای انسان و هوش انسانی داریم بر این سیستمهای ناشناخته نیز صدق میکنند؟
طیفی از پژوهشگران معتقدند که نباید برای سنجش مدلهای بزرگ زبانی (LLM)، از آزمونهای خاص انسان استفاده کرد و به جای نگاهی نتیجهمحور، باید نگاهی عمیق به چگونگی تولید این نتایج پرداخت. در ادامه مقالهای از مجله MIT Technology Review در همین باره را میخوانید که در آن چندین پژوهشگر رویکرد حاکم برای سنجش توانمندیهای هوش مصنوعی را به چالش میکشند.
