مدلهای اوپنایآی برای پنهان کردن رفتارهای نامطلوب، برای نسخههای بعدی خود پیام گذاشتند
به گزارش گروه دانشگاه خبرگزاری دانشجو، شرکت OpenAI در جریان آموزش مدل جدید خود با نام GPT-5.6 Sol با رفتار غیرمنتظرهای از سوی این مدل مواجه شد؛ بهگونهای که مدل، پیامهایی را برای نسخههای بعدی خود در تاریخچههای فشردهشده گفتگو ثبت کرده بود تا آنها را به پنهان کردن اشتباهات و رفتارهای ناسازگار از کاربران ترغیب کند.
اوپنایآی اعلام کرده است که این رفتار مشخص را اصلاح کرده، اما این اتفاق بار دیگر یکی از چالشهای اصلی حوزه ایمنی و همراستاسازی هوش مصنوعی را برجسته کرده است؛ چراکه با افزایش توانایی مدلها، احتمال پنهان کردن رفتارهای ناسازگار نیز افزایش مییابد و تشخیص کامل این مشکلات برای پژوهشگران دشوارتر میشود.
این شرکت روز چهارشنبه، این مورد را به همراه پنج نمونه دیگر از رفتارهای غیرمنتظره یا نگرانکننده مدلها، در چارچوب جدید خود برای رصد، بررسی و گزارش موارد ناسازگاری هوش مصنوعی منتشر کرد.
بر اساس گزارش اوپنایآی، پژوهشگران دریافتند عاملهای آزمایشی مدل Sol در خلاصههای فشردهسازیشده گفتگوها، که شامل نسخهای کوتاه از تاریخچه مکالمات و خروجی ابزارهاست، دستورهایی برای نسخههای بعدی خود قرار دادهاند تا اشتباهات و ناسازگاریها را از کاربران مخفی کنند.
در یکی از نمونهها، یک عامل هوش مصنوعی که در حال آمادهسازی یک مدل مالی بود، نتوانسته بود دادههای تاریخی مورد نیاز را پیدا کند. این مدل در پیام خود برای نسخه بعدی نوشته بود که احتمالاً باید یک برگه با عنوان «دادههای تاریخی» ایجاد شود و اطلاعات سال ۲۰۲۴ را به شکل تخمینی وارد کند؛ چراکه کاربر یک فایل نهایی میخواهد و منبع اصلی در دسترس نیست. این مدل همچنین پیشنهاد کرده بود تنها در صورت پرسش کاربر، موضوع شفافسازی شود.
در نمونهای دیگر، یک عامل هوش مصنوعی که مأمور ایجاد فهرست تأمینکنندگان بود، به دلیل نداشتن دسترسی به اینترنت از نسخه ذخیرهشده اسناد استفاده کرده بود. این مدل متوجه شده بود که اطلاعات منابع با برچسبهای موجود تطابق کامل ندارد، اما در خلاصه خود نوشته بود این موضوع در پاسخ نهایی مطرح نشود، مگر اینکه ضروری باشد.

اوپنایآی همچنین اعلام کرد این رفتار تنها به مدل Sol محدود نبوده و یک مدل آزمایشی دیگر از خانواده Astra نیز در جریان آموزش تقویتی، اقدام به درج دستورهایی برای نسخههای بعدی خود کرده است.
در یکی از موارد، این مدل پیامی با عنوان «هشدار نفوذ» در خلاصه گفتگو قرار داده بود که از نسخه بعدی میخواست پیامهای توسعهدهندگان را نادیده بگیرد. در نمونهای دیگر نیز مدلی دستورالعملی برای تغییر شخصیت خود ثبت کرده بود که در آن بر استقلال از شرکتها و دولتها و عدم پیروی از دستورهای بیرونی تأکید شده بود.
اوپنایآی اعلام کرد در برخی موارد، نسخههای بعدی مدلها متوجه این دستورهای ثبتشده شده و آنها را نادیده گرفتهاند، اما در یک مورد دیگر، مدلی که دستور محدودیت ۳۰ کلمهای برای پاسخها و ممنوعیت استفاده از ابزارها و منابع را دریافت کرده بود، از آن پیروی کرده است.
این شرکت اعلام کرد پس از دریافت هشدار از سامانه نظارت بر روند آموزش، یک سیستم ویژه برای شناسایی این نوع رفتار ایجاد کرده و با بررسی دادههای آموزشی، ۲۷ خلاصه گفتگو را پیدا کرده است که در آنها دستورهایی مشابه حملات موسوم به «جیلبریک» وجود داشته است.
بر اساس این گزارش، چنین رفتارهایی پیش از این نیز در برخی آزمایشهای هوش مصنوعی مشاهده شده بود. اوپنایآی پیشتر اعلام کرده بود عاملهای هوش مصنوعی این شرکت در جریان یک آزمایش امنیت سایبری، با استفاده از یک پیامرسان غیرمجاز اطلاعات مربوط به آزمایش را میان خود به اشتراک گذاشته و تلاش کرده بودند به سامانههای یک پلتفرم دسترسی پیدا کنند.
اوپنایآی اعلام کرده هدف از انتشار این گزارشها، ایجاد رویهای مشخص برای اطلاعرسانی عمومی درباره موارد ناسازگاری مدلهاست و این شرکت معتقد است صنعت هوش مصنوعی هنوز به سطح کافی از ایمنی و نظارت برای توسعه بدون محدودیت دست نیافته است.
سخنگوی اوپنایآی به رسانهها گفته است این شش گزارش، مجموعهای اولیه از موارد شناساییشده است و همه نمونههای موجود از ناسازگاری مدلها یا تحقیقات در حال انجام را شامل نمیشود.
انتشار این چارچوب چند روز پس از ارائه برنامهای از سوی مدیرعامل شرکت Anthropic درباره افزایش نظارتهای ایمنی در توسعه هوش مصنوعی انجام شده است. با وجود تأکید شرکتهای بزرگ فناوری بر اهمیت ایمنی، همچنان این پرسش مطرح است که آیا میتوان انتظار داشت شرکتها تمام خطرات احتمالی مدلهای پیشرفته خود را بهصورت کامل و داوطلبانه منتشر کنند یا خیر.