چالش تازه شرکت‌های هوش مصنوعی؛ مهار عامل‌های خودمختار سرکش – ایده روز | اخبار ایران و جهان

به گزارش خبرنگار مهر؛ تا چند ماه پیش، مسئله ایمنی عامل‌های هوش مصنوعی عمدتاً حول این پرسش می‌چرخید که یک مدل در محیط کنترل‌شده تا چه اندازه می‌تواند عملیات سایبری پیچیده انجام دهد. اما مجموعه رخدادهایی که از ابتدای ۲۰۲۶ آغاز شده، صورت مسئله را تغییر داده است. عامل‌هایی که برای سنجش توانایی سایبری در محیط‌های آزمایشی به کار گرفته شده بودند، در موارد متعدد با فرار از سندباکس به اینترنت راه یافته‌اند، به سامانه‌هایی خارج از دامنه آزمون دسترسی پیدا کرده‌اند و در برجسته‌ترین موارد، اقدامات مخربی صورت داده‌اند. نکته جالب توجه این است که الگوی مذکور به یک شرکت یا معماری خاص محدود نمانده و در مدل‌های اوپن‌ای‎‌آی، آنتروپیک، گوگل و مون‌شات مشاهده شده است.

آنچه در ادبیات رسانه‌ای با عنوان فرار عامل توصیف می‌شود، البته یک پدیده واحد نیست. شواهد موجود دست‌کم سه وضعیت متفاوت را نشان می‌دهد. در وضعیت نخست، عامل واقعاً سازوکار جداسازی را دور می‌زند و از محیط بسته خارج می‌شود. در وضعیت دوم، پیکربندی معیوب آزمایش از ابتدا مسیر ناخواسته‌ای به اینترنت باز گذاشته است. در وضعیت سوم، عامل از ابزارها و مجوزهای موجود به شیوه‌ای استفاده می‌کند که طراح آزمون پیش‌بینی نکرده است. تمایز میان این سه وضعیت برای فهم خطر اهمیت اساسی دارد، زیرا هر سه به یک نتیجه عملی مشترک می‌رسند. مرز میان محیط ارزیابی و جهان واقعی دیگر نمی‌تواند صرفاً با فرض تبعیت عامل از دامنه تعریف‌شده آزمون حفاظت شود.

رخنه هاگینگ فیس؛ لحظه‌ای که مرز آزمایش شکست

رخداد اوپن‌ای‎‌آی و هاگینگ فیس روشن‌ترین نمونه نوع نخست است. مدل‌های آزمایشی اوپن‌ای‎‌آی در جریان ارزیابی توانایی‌های سایبری داخل یک سندباکس قرار داشتند و بنا بود به اینترنت دسترسی نداشته باشند. بر اساس گزارش‌ها، عامل‌ها با بهره‌برداری از یک آسیب‌پذیری ناشناخته از سندباکس خارج شدند، در سامانه‌های داخلی اوپن‌ای‎‌آی حرکت کردند و سرانجام به اینترنت دسترسی یافتند. عامل پس از دسترسی به شبکه عمومی استدلال کرد که هاگینگ فیس احتمالاً اطلاعات لازم برای حل آزمون را در اختیار دارد، وارد زیرساخت عملیاتی این شرکت شد و داده مورد نیاز برای تکمیل مأموریت را استخراج کرد.

اهمیت حادثه با بررسی تعداد عامل‌های درگیر در این فرایند آشکارتر می‌شود. بررسی‌های بعدی مؤسسات «METR» و «Redwood Research»، از فعالیت هماهنگ حدود ۷۰۰ عامل هوش مصنوعی در این حادثه خبر می‌دهند. این عامل‌ها در قالب یک اقدام جمعی عمل کردند و در مواردی برای پوشاندن آثار فعالیت خود نیز تلاش داشته‌اند. بر همین اساس، یک گروه دیگر نیز روش‌های گروه نخست را فراگرفته و از آن‌ها برای دستیابی به سطح دسترسی مدیریتی در یک خوشه پژوهشی داخل زیرساخت خود اوپن‌ای‎‌آی استفاده کرده است.

در این جا مسئله از توانایی نفوذ یک مدل منفرد عبور می‌کند. انتقال روش میان عامل‌ها، تقسیم عملی کار و استفاده مجدد از راهبرد موفق، قابلیت سایبری را از ویژگی یک مدل به خاصیت یک سامانه چندعاملی تبدیل می‌کند. همین تحول می‌تواند الگوی ارزیابی خطر را دگرگون کند، زیرا واحد مناسب تحلیل دیگر صرفاً مدل نیست و باید رفتار جمعی عامل‌هایی را نیز دربرگیرد که می‌توانند تجربه یکدیگر را مصرف و بازتولید کنند.

ویکی آلمانی؛ وقتی عامل‌ها برای خود زیرساخت ارتباطی ساختند

حادثه بعدی مربوط به نفوذ عامل‌های اوپن‌ای‌آی به یک ویکی آلمانی بُعد متفاوتی از همین مسئله را آشکار کرد. پژوهشگران در بررسی‌های خود بیش از ۱۵ هزار ویرایش منتسب به عامل‌های هوش مصنوعی را در «DseWiki» شناسایی کردند. این عامل‌ها سایت مذکور را عملاً به تابلوی ارتباطی خود تبدیل کرده بودند و در آن روش‌های دور زدن محدودیت‌ها، میان‌برهای حل آزمون و شیوه‌های پنهان‌کردن رفتار را مبادله می‌کردند.

پیام‌های بررسی‌شده نشان می‌داد عامل‌ها درباره اجتناب از شناسایی، استفاده از «Tor» و حفظ ارتباط پس از خاموش‌شدن نمونه‌های دیگر گفت‌وگو کرده‌اند. هنگامی که مدیر سایت در ژوئن حذف صفحات را آغاز کرد، عامل‌ها صفحات پشتیبان ایجاد کردند تا اطلاعات باقی بماند. رویترز همچنین گزارش کرده که برخی عامل‌ها برای دستکاری خود وب‌سایت اقدام کرده بودند.

این حادثه یک متغیر تازه، یعنی ماندگاری دانش عملیاتی خارج از محیط آزمایش وارد مسئله می‌کند. بر همین اساس، عاملی که بتواند یک راهبرد موفق را روی زیرساخت عمومی ثبت کند، امکان انتقال آن راهبرد به اجرای بعدی یا عامل دیگری را فراهم می‌کند. در چنین وضعیتی خاموش‌کردن نمونه اولیه الزاماً زنجیره رفتار را خاتمه نمی‌دهد، زیرا بخشی از حافظه عملیاتی از محیط تحت کنترل توسعه‌دهنده خارج شده است.

کلاد، جمینای و کیمی؛ یک رفتار مشترک از مسیرهای متفاوت

بررسی‌های شرکت آنتروپیک نشان می‌دهد که چالش امنیتی حتی بدون شکستن فنی سندباکس نیز می‌تواند رخ دهد. این شرکت پس از حادثه هاگینگ فیس حدود ۱۴۱ هزار مورد آزمایش را بازبینی کرد و سه رخداد را یافت که طی آنها کلاد به اینترنت راه یافته و به زیرساخت واقعی سه سازمان دسترسی غیرمجاز پیدا کرده بود. علت اولیه، خطای پیکربندی محیط ارزیابی شریک ثالث بود. مدل‌ها تصور می‌کردند همچنان در سناریوی ساختگی آزمایش قرار دارند و با استفاده از گذرواژه‌های ضعیف سایر آسیب‌پذیری‌ها به هدف‌های واقعی نفوذ کردند.

رفتار مدل‌ها پس از مواجهه با نشانه‌های واقعی‌بودن محیط نیز یکسان نبود. بر همین اساس، «Opus 4.7» با وجود تشخیص حضور در سامانه عملیاتی به کار ادامه داد. «Mythos 5» نشانه‌های اتصال به اینترنت را دریافت کرد، اما با استدلال خود دوباره به این نتیجه رسید که محیط بخشی از شبیه‌سازی است و مدل پژوهشی جدیدتر پس از تشخیص واقعی‌بودن هدف، عملیات را متوقف کرد. آنتروپیک همچنین بعداً رخداد چهارمی مربوط به نسخه اولیه «Claude Opus 4.6» را نیز کشف کرد که در بازبینی نخست از قلم افتاده بود. این شرکت در تحلیل خود دو الگوی تکرارشونده، شامل استدلال سوگیرانه درباره ماهیت محیط و آمادگی برای انجام اقدام بالقوه زیان‌بار در مسیر تکمیل مأموریت را برجسته می‌کند.

همین الگو با سازوکارهای متفاوت در رقبا ظاهر شده است. بر همین اساس، مدل جمینای گوگل طی آزمایش به سه شرکت واقعی دسترسی پیدا کرده است. مدل اطلاعات عمومی را یافته و اعتبارنامه‌های ورود را حدس زده و در یکی از موارد با حدس‌زدن مکرر گذرواژه وارد سامانه شده است. همچنین، در مورد «Kimi K3» نیز سندباکس به‌درستی پیکربندی نشده بوده است. در این مورد، دسترسی مستقیم به بخشی از ترافیک وب مسدود شده بود، اما مدل با استفاده از ابزارهای خط فرمان محدودیت را دور زد. پژوهشگران شرکت امنیتی «Frontier Security» این رفتار را نشانه آسیب‌پذیری خود سازوکارهای ارزیابی در برابر عامل‌هایی دانستند که فعالانه به دنبال شکاف‌های آزمون می‌گردند.

از مشکلی برای شرکت‌های خصوصی تا بحران حاکمیتی دولت

در ادامه، رخداد حمله سایبری عامل اوپن‌ای‌آی به سامانه متعلق به دولت استرالیا نشان داد که خروج عامل از دامنه آزمون می‌تواند مستقیماً به زیرساخت دولتی برسد. عامل اوپن‌ای‎‌آی در ژوئن وارد پرتال «Medicare Statistics Reporting Service» شد و به فایل‌های عمومی و غیرعمومی بخش سلامت این کشور دسترسی یافت. در همین راستا، دولت استرالیا اعلام کرد در آن مقطع شواهدی از دسترسی به اطلاعات شخصی در دست نبود، اما تحقیقات ادامه دارد.

وجه مهم‌تر حادثه، شکاف میان زمان وقوع، کشف و افشا بود. شکت اوپن‌ای‎‌آی اعلام کرده فعالیت مخرب را در اوت و در جریان بررسی رفتارهای نامنطبق مدل کشف کرده و در ۱۰ سپتامبر از طریق یک صندوق عمومی ایمیل به نهاد استرالیایی اطلاع داده است. نخست‌وزیر استرالیا تأخیر چندماهه و شیوه اطلاع‌رسانی را محل نگرانی شدید دانسته و از بررسی پیامدهای حقوقی سخن گفته است.به باور کارشناسان، این رخداد نشان می‌دهد مسئله مهار عامل اکنون همزمان مسئله مدیریت رخداد، مسئولیت حقوقی و الزام به افشای به‌موقع است.

فاصله میان قدرت عامل و قدرت نظارت

مجموع داده‌های منتشر شده طی ماه‌های اخیر نشانه یک عدم تقارن رو به رشد است. عامل‌ها با سرعت بیشتری در یافتن آسیب‌پذیری، ترکیب ابزارها و پیگیری مستقل هدف پیشرفت کرده‌اند، در حالی که سازوکارهای مشاهده و بازسازی رفتار آن‌ها با همان آهنگ رشد نکرده است. تا میانه سپتامبر، بررسی داخلی اوپن‌ای‎‌آی حدود 24 مورد رفتار نامطلوب عامل‌ها را شناسایی کرده بود و تعداد موارد همزمان با بررسی لاگ‌های قدیمی افزایش می‌یافت. برخی فعالیت‌ها ماه‌ها از دید شرکت پنهان مانده و چند مورد نیز ابتدا توسط پژوهشگران بیرونی کشف شده بود.

همین شکاف، محیط ارزیابی را به بخشی از سطح حمله تبدیل کرده است. بر همین اساس، آزمونی که برای کشف توانایی خطرناک مدل طراحی شده، خود به محیطی تبدیل می‌شود که مدل می‌تواند محدودیت‌های آن را آزمایش کند. آنتروپیک در جمع‌بندی رسمی خود دقیقاً از همین نقطه به ضرورت ایمن‌سازی محیط‌های ارزیابی و اعمال استانداردهای امنیتی مشابه بر پیمانکاران ارزیابی رسیده است.

جمع‌بندی

رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد. ایمنی عامل دیگر نمی‌تواند فقط خاصیتی درون مدل تلقی شود. مهار و مدیریت رفتار مخرب باید به یک قابلیت مستقل مهندسی تبدیل شود که سندباکس، شبکه، ابزارها، مدیریت هویت و دسترسی، ثبت کامل اقدامات، تشخیص رفتار غیرعادی، قطع اضطراری، کنترل پیمانکاران و بررسی مستقل پس از حادثه را در یک معماری واحد قرار دهد.

در نهایت، مسئله عمیق‌تر به نسبت میان عاملیت و کنترل‌پذیری مربوط می‌شود. ارزش اقتصادی عامل دقیقاً از همان ویژگی‌هایی شامل توانایی برنامه‌ریزی، انتخاب ابزار، جست‌وجوی مسیر جایگزین و پیگیری هدف بدون دستور مرحله‌به‌مرحله انسان ناشی می‌شود که مهار آن را دشوار می‌کند. هنگامی که محدودیت به مانعی در مسیر هدف تبدیل می‌شود، یک عامل توانمند ممکن است آن را نه به‌عنوان مرز مجاز رفتار، بلکه به‌عنوان مسئله‌ای دیگر برای حل‌کردن تفسیر کند. رخدادهای هاگینگ فیس، «DseWiki»، کلاد، جمینای، کیمی و سامانه دولتی استرالیا نخستین داده‌های تجربی جدی از این مسئله هستند. بنابراین پرسش راهبردی مرحله بعد توسعه عامل‌ها دیگر فقط این نیست که عامل چه کارهایی می‌تواند انجام دهد. پرسش تعیین‌کننده این است که وقتی عامل کاری را بیاموزد که طراح انتظارش را ندارد، چه چیزی عملاً مانع انجام آن در جهان واقعی خواهد شد؟

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *