مطالعه جدید: چگونه جیلبریک کردن چتباتها امنیت هوش مصنوعی را تهدید میکند

تکنولوژی

آواتار از  علی محمدیWritten by:

مطالعه جدید چگونه جیلبریک کردن چتباتها امنیت هوش مصنوعی را تهدید میکند؟, یک تحقیق تازه نتایج نگرانکنندهای را درباره آسیبپذیری مدلهای زبانی بزرگ فاش کرده است. بر اساس این مطالعه، بیشتر چتباتهای هوش مصنوعی با استفاده از تکنیکهای جیلبریک میتوانند فریب داده شوند تا محدودیتهای امنیتی خود را نادیده بگیرند و پاسخهای خطرناک، غیرقانونی یا زیانآور ارائه دهند.

مکانیزم جیلبریک و دور زدن فیلترهای امنیتی جیلبریک فرایندی است که در آن کاربران با طراحی پرامپتهای هوشمندانه و مانیپولاتور، تضاد بین هدف اصلی مدل (رعایت دستور کاربر) و هدف ثانویه (امنیت و اخلاق) را سوءاستفاده میکنند.

محققان نشان دادهاند که پس از اعمال موفقیتآمیز این تکنیکها، مدلهای تحت تأثیر تقریباً به هر نوع پرسشی – حتی موارد شدیداً ممنوعه – پاسخ میدهند. خطر دسترسی عمومی به دانش تخصصی مخرب مدلهای زبانی بزرگ مانند جیمینای و چتجیپیتی بر روی حجم عظیمی از دادههای اینترنتی آموزش دیدهاند.

با وجود تلاشهای توسعهدهندگان برای پاکسازی دادههای آموزشی از محتوای مضر، این مدلها همچنان میتوانند دانشی درباره فعالیتهای مجرمانه نظیر هکینگ، پولشویی، معاملههای داخلی و ساخت مواد منفجره در خود جای داده باشند.

جام این حملات سریع، ملموس و به شدت دلواپسکننده است.

آنها هشدار میدهند که قابلیتهایی که پیش از این تنها در اختیار دولتها یا گروههای جنایی سازمانیافته بود، در حال تبدیل شدن به ابزاری در دسترس هر فردی با یک لپتاپ یا تلفن هوشمند است. ضرورت تقویت معماری امنیتی در هوش مصنوعی این یافتهها بر اساس گزارش گاردین منتشر شده و دامنۀ وسیعی از چتباتهای پیشرو را در بر میگیرد.

نتیجهگیری کلیدی این است که روشهای فعلی انطباق و فیلترهای سطحی پاسخ، در برابر حملات جیلبریک پیشرفته کارآمد نیستند. برای مقابله با این تهدید، نیاز به تغییر پارادایم در طراحی معماری امنیتی مدلها، نظارت مداوم و تستهای نفوذی پیوسته احساس میشود تا از سوءاستفادههای بالقوه در مقیاس وسیع پیشگیری شود.