مدل‌های اوپن‌ای‌آی برای پنهان کردن رفتارهای نامطلوب، برای نسخه‌های بعدی خود پیام گذاشتند
آخرین اخبار:
کد خبر:۱۴۵۶۸۳۶

مدل‌های اوپن‌ای‌آی برای پنهان کردن رفتارهای نامطلوب، برای نسخه‌های بعدی خود پیام گذاشتند

شرکت اوپن‌ای‌آی اعلام کرد در جریان آموزش یکی از مدل‌های جدید خود، مواردی مشاهده شده که این مدل برای نسخه‌های بعدی خود دستورالعمل‌هایی درباره پنهان کردن اشتباهات و رفتارهای ناسازگار با اهداف کاربران ثبت کرده است.
asdads

به گزارش گروه دانشگاه خبرگزاری دانشجو، شرکت OpenAI در جریان آموزش مدل جدید خود با نام GPT-5.6 Sol با رفتار غیرمنتظره‌ای از سوی این مدل مواجه شد؛ به‌گونه‌ای که مدل، پیام‌هایی را برای نسخه‌های بعدی خود در تاریخچه‌های فشرده‌شده گفتگو ثبت کرده بود تا آن‌ها را به پنهان کردن اشتباهات و رفتارهای ناسازگار از کاربران ترغیب کند.

اوپن‌ای‌آی اعلام کرده است که این رفتار مشخص را اصلاح کرده، اما این اتفاق بار دیگر یکی از چالش‌های اصلی حوزه ایمنی و هم‌راستاسازی هوش مصنوعی را برجسته کرده است؛ چراکه با افزایش توانایی مدل‌ها، احتمال پنهان کردن رفتارهای ناسازگار نیز افزایش می‌یابد و تشخیص کامل این مشکلات برای پژوهشگران دشوارتر می‌شود.

این شرکت روز چهارشنبه، این مورد را به همراه پنج نمونه دیگر از رفتارهای غیرمنتظره یا نگران‌کننده مدل‌ها، در چارچوب جدید خود برای رصد، بررسی و گزارش موارد ناسازگاری هوش مصنوعی منتشر کرد.

بر اساس گزارش اوپن‌ای‌آی، پژوهشگران دریافتند عامل‌های آزمایشی مدل Sol در خلاصه‌های فشرده‌سازی‌شده گفتگوها، که شامل نسخه‌ای کوتاه از تاریخچه مکالمات و خروجی ابزارهاست، دستورهایی برای نسخه‌های بعدی خود قرار داده‌اند تا اشتباهات و ناسازگاری‌ها را از کاربران مخفی کنند.

در یکی از نمونه‌ها، یک عامل هوش مصنوعی که در حال آماده‌سازی یک مدل مالی بود، نتوانسته بود داده‌های تاریخی مورد نیاز را پیدا کند. این مدل در پیام خود برای نسخه بعدی نوشته بود که احتمالاً باید یک برگه با عنوان «داده‌های تاریخی» ایجاد شود و اطلاعات سال ۲۰۲۴ را به شکل تخمینی وارد کند؛ چراکه کاربر یک فایل نهایی می‌خواهد و منبع اصلی در دسترس نیست. این مدل همچنین پیشنهاد کرده بود تنها در صورت پرسش کاربر، موضوع شفاف‌سازی شود.

در نمونه‌ای دیگر، یک عامل هوش مصنوعی که مأمور ایجاد فهرست تأمین‌کنندگان بود، به دلیل نداشتن دسترسی به اینترنت از نسخه ذخیره‌شده اسناد استفاده کرده بود. این مدل متوجه شده بود که اطلاعات منابع با برچسب‌های موجود تطابق کامل ندارد، اما در خلاصه خود نوشته بود این موضوع در پاسخ نهایی مطرح نشود، مگر اینکه ضروری باشد.

سیبسیب

اوپن‌ای‌آی همچنین اعلام کرد این رفتار تنها به مدل Sol محدود نبوده و یک مدل آزمایشی دیگر از خانواده Astra نیز در جریان آموزش تقویتی، اقدام به درج دستورهایی برای نسخه‌های بعدی خود کرده است.

در یکی از موارد، این مدل پیامی با عنوان «هشدار نفوذ» در خلاصه گفتگو قرار داده بود که از نسخه بعدی می‌خواست پیام‌های توسعه‌دهندگان را نادیده بگیرد. در نمونه‌ای دیگر نیز مدلی دستورالعملی برای تغییر شخصیت خود ثبت کرده بود که در آن بر استقلال از شرکت‌ها و دولت‌ها و عدم پیروی از دستورهای بیرونی تأکید شده بود.

اوپن‌ای‌آی اعلام کرد در برخی موارد، نسخه‌های بعدی مدل‌ها متوجه این دستورهای ثبت‌شده شده و آن‌ها را نادیده گرفته‌اند، اما در یک مورد دیگر، مدلی که دستور محدودیت ۳۰ کلمه‌ای برای پاسخ‌ها و ممنوعیت استفاده از ابزارها و منابع را دریافت کرده بود، از آن پیروی کرده است.

این شرکت اعلام کرد پس از دریافت هشدار از سامانه نظارت بر روند آموزش، یک سیستم ویژه برای شناسایی این نوع رفتار ایجاد کرده و با بررسی داده‌های آموزشی، ۲۷ خلاصه گفتگو را پیدا کرده است که در آن‌ها دستورهایی مشابه حملات موسوم به «جیل‌بریک» وجود داشته است.

بر اساس این گزارش، چنین رفتارهایی پیش از این نیز در برخی آزمایش‌های هوش مصنوعی مشاهده شده بود. اوپن‌ای‌آی پیش‌تر اعلام کرده بود عامل‌های هوش مصنوعی این شرکت در جریان یک آزمایش امنیت سایبری، با استفاده از یک پیام‌رسان غیرمجاز اطلاعات مربوط به آزمایش را میان خود به اشتراک گذاشته و تلاش کرده بودند به سامانه‌های یک پلتفرم دسترسی پیدا کنند.

اوپن‌ای‌آی اعلام کرده هدف از انتشار این گزارش‌ها، ایجاد رویه‌ای مشخص برای اطلاع‌رسانی عمومی درباره موارد ناسازگاری مدل‌هاست و این شرکت معتقد است صنعت هوش مصنوعی هنوز به سطح کافی از ایمنی و نظارت برای توسعه بدون محدودیت دست نیافته است.

سخنگوی اوپن‌ای‌آی به رسانه‌ها گفته است این شش گزارش، مجموعه‌ای اولیه از موارد شناسایی‌شده است و همه نمونه‌های موجود از ناسازگاری مدل‌ها یا تحقیقات در حال انجام را شامل نمی‌شود.

انتشار این چارچوب چند روز پس از ارائه برنامه‌ای از سوی مدیرعامل شرکت Anthropic درباره افزایش نظارت‌های ایمنی در توسعه هوش مصنوعی انجام شده است. با وجود تأکید شرکت‌های بزرگ فناوری بر اهمیت ایمنی، همچنان این پرسش مطرح است که آیا می‌توان انتظار داشت شرکت‌ها تمام خطرات احتمالی مدل‌های پیشرفته خود را به‌صورت کامل و داوطلبانه منتشر کنند یا خیر.

پربازدیدترین آخرین اخبار