واترمارک هوش مصنوعی میتواند سدهای ایمنی مدلها را تضعیف کند
به گزارش گروه دانشگاه خبرگزاری دانشجو، پژوهش جدیدی درباره تأثیر فناوری واترمارک هوش مصنوعی نشان میدهد این فناوری که با هدف شناسایی محتوای تولیدشده توسط مدلهای هوش مصنوعی توسعه یافته است، ممکن است در برخی شرایط ناخواسته رفتار مدلها را تغییر دهد.
بر اساس این تحقیق، فناوری SynthID-Text که توسط گوگل توسعه یافته و بهصورت متنباز منتشر شده است، تنها نحوه انتخاب کلمات توسط مدل را تغییر نمیدهد، بلکه میتواند بر تصمیمهای امنیتی مدل و میزان پایبندی آن به محدودیتهای ایمنی نیز اثر بگذارد.
این پژوهش پس از آن مورد توجه قرار گرفته که شرکتهای توسعهدهنده هوش مصنوعی، در پی قوانین جدید اتحادیه اروپا، به سمت استفاده از روشهایی برای علامتگذاری محتوای تولیدشده توسط هوش مصنوعی حرکت کردهاند. شرکت آنتروپیک نیز اعلام کرده مدلهای آینده «Claude» از فناوری SynthID-Text استفاده خواهند کرد.
محققان شرکت امنیتی Lasso Security با بررسی چندین مدل هوش مصنوعی متنباز، پاسخ مدلها را در شرایط استفاده از واترمارک و بدون آن مقایسه کردند. نتایج نشان داد در برخی آزمایشها، مدلهایی که معمولاً درخواستهای خطرناک را رد میکردند، پس از اعمال واترمارک احتمال بیشتری برای پاسخگویی به این درخواستها داشتند.

«آندریا سیپوسووا» پژوهشگر امنیت هوش مصنوعی در شرکت Lasso Security، اعلام کرد واترمارک اگرچه برای کاربران قابل مشاهده نیست، اما تغییر در فرآیند تولید متن میتواند پیامدهایی در رفتار مدل ایجاد کند.
وی توضیح داد که این تغییرات زمانی جدیتر میشوند که مدلها در شرایط حملات موسوم به «تزریق فرمان» قرار بگیرند؛ حملاتی که در آن مهاجم تلاش میکند هوش مصنوعی را به انجام اقداماتی مانند افشای اطلاعات حساس یا عبور از محدودیتهای امنیتی وادار کند.
فناوری SynthID-Text با استفاده از یک کلید مخفی، فرآیند انتخاب واژههای بعدی توسط مدل را تغییر میدهد تا امکان تشخیص متن تولیدشده توسط هوش مصنوعی فراهم شود. این فناوری با روشی به نام نمونهبرداری تورنمنتی میان گزینههای مختلف انتخاب کلمه رقابت ایجاد کرده و در نهایت واژهای را انتخاب میکند که با کلید مخفی سازگار باشد.
پژوهشگران همچنین دریافتند تغییر کلید مخفی مورد استفاده در واترمارک میتواند باعث تفاوت در رفتار مدل شود. در برخی موارد، این تغییر بر نحوه استفاده مدل از ابزارها و میزان موفقیت حملات مخرب تأثیر گذاشته است.
این تحقیق البته محدودیتهایی نیز دارد؛ زیرا آزمایشها روی مدلهای متنباز انجام شده و رفتار مدلهای اختصاصی مانند نسخههای آینده Claude تحت بررسی قرار نگرفته است. همچنین محققان از پیادهسازی متنباز SynthID-Text استفاده کردهاند و مشخص نیست نسخههای تجاری دقیقاً چه رفتاری خواهند داشت.
با این حال، نتایج این پژوهش نشان میدهد توسعهدهندگان هوش مصنوعی باید پیش از استفاده گسترده از فناوریهای واترمارک، تأثیر آنها بر ایمنی مدلها و عملکرد عاملهای هوش مصنوعی را بهطور دقیق آزمایش کنند.