واترمارک هوش مصنوعی می‌تواند سدهای ایمنی مدل‌ها را تضعیف کند
آخرین اخبار:
کد خبر:۱۴۵۶۸۳۸
پژوهش جدید نشان داد؛

واترمارک هوش مصنوعی می‌تواند سدهای ایمنی مدل‌ها را تضعیف کند

یک تحقیق امنیتی جدید نشان می‌دهد استفاده از فناوری واترمارک‌گذاری متن‌های تولیدشده توسط هوش مصنوعی ممکن است در برخی شرایط باعث تغییر رفتار مدل‌ها شده و حتی احتمال اجرای درخواست‌های مخرب را افزایش دهد.
شسیشس

به گزارش گروه دانشگاه خبرگزاری دانشجو، پژوهش جدیدی درباره تأثیر فناوری واترمارک هوش مصنوعی نشان می‌دهد این فناوری که با هدف شناسایی محتوای تولیدشده توسط مدل‌های هوش مصنوعی توسعه یافته است، ممکن است در برخی شرایط ناخواسته رفتار مدل‌ها را تغییر دهد.

بر اساس این تحقیق، فناوری SynthID-Text که توسط گوگل توسعه یافته و به‌صورت متن‌باز منتشر شده است، تنها نحوه انتخاب کلمات توسط مدل را تغییر نمی‌دهد، بلکه می‌تواند بر تصمیم‌های امنیتی مدل و میزان پایبندی آن به محدودیت‌های ایمنی نیز اثر بگذارد.

این پژوهش پس از آن مورد توجه قرار گرفته که شرکت‌های توسعه‌دهنده هوش مصنوعی، در پی قوانین جدید اتحادیه اروپا، به سمت استفاده از روش‌هایی برای علامت‌گذاری محتوای تولیدشده توسط هوش مصنوعی حرکت کرده‌اند. شرکت آنتروپیک نیز اعلام کرده مدل‌های آینده «Claude» از فناوری SynthID-Text استفاده خواهند کرد.

محققان شرکت امنیتی Lasso Security با بررسی چندین مدل هوش مصنوعی متن‌باز، پاسخ مدل‌ها را در شرایط استفاده از واترمارک و بدون آن مقایسه کردند. نتایج نشان داد در برخی آزمایش‌ها، مدل‌هایی که معمولاً درخواست‌های خطرناک را رد می‌کردند، پس از اعمال واترمارک احتمال بیشتری برای پاسخ‌گویی به این درخواست‌ها داشتند.

بسیبس

 

«آندریا سیپوسووا» پژوهشگر امنیت هوش مصنوعی در شرکت Lasso Security، اعلام کرد واترمارک اگرچه برای کاربران قابل مشاهده نیست، اما تغییر در فرآیند تولید متن می‌تواند پیامدهایی در رفتار مدل ایجاد کند.

وی توضیح داد که این تغییرات زمانی جدی‌تر می‌شوند که مدل‌ها در شرایط حملات موسوم به «تزریق فرمان» قرار بگیرند؛ حملاتی که در آن مهاجم تلاش می‌کند هوش مصنوعی را به انجام اقداماتی مانند افشای اطلاعات حساس یا عبور از محدودیت‌های امنیتی وادار کند.

فناوری SynthID-Text با استفاده از یک کلید مخفی، فرآیند انتخاب واژه‌های بعدی توسط مدل را تغییر می‌دهد تا امکان تشخیص متن تولیدشده توسط هوش مصنوعی فراهم شود. این فناوری با روشی به نام نمونه‌برداری تورنمنتی میان گزینه‌های مختلف انتخاب کلمه رقابت ایجاد کرده و در نهایت واژه‌ای را انتخاب می‌کند که با کلید مخفی سازگار باشد.

پژوهشگران همچنین دریافتند تغییر کلید مخفی مورد استفاده در واترمارک می‌تواند باعث تفاوت در رفتار مدل شود. در برخی موارد، این تغییر بر نحوه استفاده مدل از ابزارها و میزان موفقیت حملات مخرب تأثیر گذاشته است.

این تحقیق البته محدودیت‌هایی نیز دارد؛ زیرا آزمایش‌ها روی مدل‌های متن‌باز انجام شده و رفتار مدل‌های اختصاصی مانند نسخه‌های آینده Claude تحت بررسی قرار نگرفته است. همچنین محققان از پیاده‌سازی متن‌باز SynthID-Text استفاده کرده‌اند و مشخص نیست نسخه‌های تجاری دقیقاً چه رفتاری خواهند داشت.

با این حال، نتایج این پژوهش نشان می‌دهد توسعه‌دهندگان هوش مصنوعی باید پیش از استفاده گسترده از فناوری‌های واترمارک، تأثیر آن‌ها بر ایمنی مدل‌ها و عملکرد عامل‌های هوش مصنوعی را به‌طور دقیق آزمایش کنند.

پربازدیدترین آخرین اخبار