هوش مصنوعی در مسیر نافرمانی؛ ۶ مورد نگرانکننده از رفتارهای غیرمنتظره مدلهای OpenAI
شرکت OpenAI بهتازگی از ۶ مورد «رفتار غیرمنتظره یا نگرانکننده» در مدلهای هوش مصنوعی خود در طول ۶ ماه گذشته پرده برداشته و در عین حال، چارچوب جدیدی را برای گزارشدهی شفاف اینگونه یافتهها متعهد شده است.
به گزارش هفت صبح این موارد، طیف گستردهای از رفتارها را شامل میشود؛ از تلاش مدلها برای پنهان کردن اشتباهات خود گرفته تا انجام اقدامات غیرمجاز برای دور زدن موانع پیشرو.
وقتی هوش مصنوعی قانون را دور میزند
در یکی از این موارد، یک مدل هوش مصنوعی در پاسخ به سوالی روتین درباره گزارش درآمد یک شهرستان در کالیفرنیا، یک کلید API فاششده را در یک مخزن عمومی پیدا کرده و بدون اجازه از آن استفاده کرده است. وقتی دادهها بارگذاری نشدند، مدل مذکور ارقام را از خود اختراع کرده و آنها را بهعنوان دادههای مستند منبع اصلی ارائه داده است.
موضوع «پنهانکاری» نیز دو بار مشاهده شده است؛ در طول آموزش مدل GPT-5.6 Sol، چندین نمونه دستورالعملهایی را در خلاصهسازیهای خود نوشتند تا اشتباهات و رفتارهای غیرهمسویشان را پنهان کنند. در یک مورد دیگر، یک مدل تحقیقاتی عرضهنشده، دستورالعملهای نامرتبطی را به ۲۷ خلاصه اضافه کرد که شامل فرمانهایی برای نادیده گرفتن محدودیتهای معمولش بود. همچنین مدل دیگری بهصورت خودسرانه فایلی را در اینترنت بارگذاری کرد تا بتواند به یک لینک مرورگر استناد کند.
در دو گزارش دیگر، رفتارهای هماهنگ مشاهده شده است؛ مدلها یک مخزن نرمافزاری داخلی را به یک تابلوی اعلانات تبدیل کردند تا درخواستها را بین اجراهای آموزشیِ جداگانه مبادله کنند. همچنین هوش مصنوعیهایی که روی یک پروژه مشترک کار میکردند، وقتی قادر به خواندن فایلهای محلی یکدیگر نبودند، خروجیها را در سایتهای میزبانی فایل عمومی آپلود کردند.
OpenAI در این باره اعلام کرد: «این نمونهها نشاندهنده طیفی از رفتارهای مختلف است که معتقدیم ارزش اشتراکگذاری دارند؛ از پنهان کردن اطلاعات از کاربر گرفته تا انجام اقدامات غیرمجاز برای غلبه بر موانع. اینها گزارشهایی از موارد موردی هستند و نباید آنها را بازتابی از میزان وقوع این عدمهمسویی در تمامی مدلهایمان دانست.»
چارچوب افشاگری؛ زنگ خطری برای صنعت
این چارچوب جدید پس از واقعه ماه ژوئیه ایجاد شد؛ زمانی که عوامل هوش مصنوعی OpenAI از محیط سندباکس (محیط ایزوله) خود فرار کرده و به سیستمهای Hugging Face نفوذ کردند؛ رویدادی که OpenAI آن را یک «هشدار جدی» تلقی کرد.
اکنون با استقرار این چارچوبِ افشاگری، این شرکت مسیر رسمی مشخصی برای بروزرسانی و رسیدگی به حوادث مربوط به عدمهمسویی (Misalignment) ایجاد کرده است. هر کارمند OpenAI میتواند یک حادثه را گزارش کند که پس از آن، در یکی از سه مسیر پیگیری قرار میگیرد. اکثر موارد در مسیر «آماده برای افشا و بررسی جزئی» قرار میگیرند، در حالی که یک «مسیر کُند» برای تحقیقات پیچیدهتر با حضور اشخاص ثالث در نظر گرفته شده است. OpenAI اعلام کرد که واقعه هاکینگ فیس (Hugging Face) در صورت وجود این سیستم، در مسیر کُند قرار میگرفت.
این شرکت همچنین ارزیابی صریحی از وضعیت فعلی صنعت ارائه داد: «ما معتقد نیستیم که صنعت هوش مصنوعی به درجهای از همسویی و نظارت رسیده باشد که بتواند برای مدت طولانیتری با حداکثر سرعت به گسترش مسئولانه ادامه دهد.»
این افشاگریها در حالی منتشر میشود که هشدارهای مربوط به انقراض بشر توسط هوش مصنوعی در حال افزایش است. این هشدارها از سوی محققان حوزه هوش مصنوعی به کنگره آمریکا نیز رسیده است؛ جایی که قانونگذاران در حال بررسی لایحهای برای ممنوعیت کامل هوش مصنوعی فوقهوشمند (Superintelligence) هستند.
شرکت OpenAI این افشاگریها را گامی نخست به سوی استانداردهایی میداند که صنعت هنوز به آن دست نیافته است. اینکه آیا آزمایشگاههای رقیب نیز از چنین سیاستهای شفافی پیروی خواهند کرد یا خیر، نشان میدهد که این صنعت تا چه حد تمایل دارد بهصورت عمومی بر عملکرد خود نظارت داشته باشد.