هوش مصنوعی چطور پاسخهای مشکوک خودش را لو میدهد؟
مدلهای هوش مصنوعی گاهی اوقات پاسخی کاملاً اشتباه را با اعتمادبهنفسی باورنکردنی تحویل کاربر میدهند.
به گزارش هفت صبح در نقطهی مقابل، در مواردی هم دیده میشود که این مدلها احتیاط به خرج میدهند و میگویند مطمئن نیستند، در حالی که پاسخشان کاملاً درست است.
اکنون پژوهشی تازه به سرپرستی دانشمندان علوم کامپیوتر در دانشگاه کالیفرنیا، ریورساید (UCR)، پرده از علت این معما برمیدارد. پژوهشگران دریافتهاند که «میزان اطمینان مدل» و «صحت پاسخ آن» از بخشها و الگوهای درونی متفاوتی در مدلهای زبانی بزرگ سرچشمه میگیرند؛ یافتهای که فرض رایج پیشین را به چالش میکشد؛ فرضی که ادعا میکرد لحن مطمئن یک مدل، نشانهای حتمی از درست بودن پاسخ آن است.
این کشف که در پایگاه مقالات پیشانتشار arXiv منتشر شده، میتواند گامی کلیدی در ساخت هوش مصنوعی قابلاعتمادتر باشد. همزمان با گسترش روزافزون نقش مدلهای زبانی در تصمیمگیریهای حیاتی و انجام امور مختلف، توسعهدهندگان بیش از هر زمان دیگری به ابزارهایی نیاز دارند تا مرز میان پاسخهای مطمئن و نامعتبر را تشخیص دهند.
محققان با تفکیک و شناسایی ویژگیهای درونیِ مرتبط با «اطمینان» از ویژگیهای مربوط به «درستی»، به راهکاری دست یافتهاند که میتواند رفتار هوش مصنوعی را تنظیم کند: سیستم در زمان پاسخهای درست با اطمینان صحبت کند و در شرایطی که احتمال خطا وجود دارد، با احتیاط عمل نماید.
هت پاتل (Het Patel)، دانشجوی دکترای علوم کامپیوتر در UCR و نویسنده اصلی مقاله، در اینباره میگوید:
«فرض اصلی در این حوزه همیشه این بوده که وقتی مدل با اعتمادبهنفس سخن میگوید احتمالاً پاسخ درست است، و هرگاه ابراز تردید کند احتمال خطا بیشتر خواهد بود. با این حال، موارد نقض بیشماری ثبت شده است؛ مدلی که با قاطعیت پاسخی غلط ارائه میدهد، یا پاسخی کاملاً درست که با تردید و تزلزل تحویل داده میشود.»
تیم پژوهشی فراتر از صرفِ ثبت این ناهماهنگی پیش رفت. آنها ویژگیهای درونی متناظر با هر دو مؤلفه را پیدا کردند و نشان دادند که با دستکاریِ هدفمند برخی از آنها، میتوان رفتار هوش مصنوعی را بدون نیاز به فرآیند پرهزینه و طاقتفرسای بازآموزیِ کل مدل (Retraining)، اصلاح کرد.
تفکیک «اطمینان» از «صحت پاسخ»
پاتل توضیح میدهد که مدلهای هوش مصنوعی امروزی از طریق آموزش شبکههای عظیم ریاضی روی اقیانوسی از دادهها خلق میشوند. در طول این آموزش، شبکه میلیاردها پارامتر عددی (که به اصطلاح وزن یا Weights نامیده میشوند) را مرتباً تغییر میدهد تا الگوها را بیاموزد. در یک مدل زبانی، همین الگوهای یادگرفتهشده امکان پیشبینی کلمات بعدی و در نهایت تولید جملات پاسخ را رقم میزنند.
پرسش اصلی تیم پاتل این بود: وقتی بین «اطمینان کلامی مدل» و «صحت علمی پاسخ» شکاف وجود دارد، در درون شبکه عصبی دقیقاً چه اتفاقی رخ میدهد؟
آنها دو مدل زبانی متنباز و در دسترس شامل Llama-3.1-8B متا و Gemma-2-9B گوگل را بررسی کردند؛ مدلهایی که به محققان اجازه میدهند کارکرد درونی آنها را به دقت واکاوی کنند. پژوهشگران با استفاده از پرسشهای چهارگزینهای، خروجیها را به چهار دسته بخشبندی کردند:
- درست و بااطمینان
- درست اما با تردید
- اشتباه و بااطمینان
- اشتباه و همراه با تردید
سپس با ابزاری موسوم به Sparse Autoencoders سیگنالها و فعالیتهای داخلی شبکه را زیر ذرهبین قرار دادند تا ببینند هنگام بروز هر رفتار، دقیقاً کدام ویژگیها و گرهها در مدل فعال میشوند.
این تحلیل سه دسته الگو و ویژگی درونی را آشکار کرد:
- ویژگیهایی که صرفاً با تردید و نااطمینانی مرتبط بودند.
- ویژگیهایی که عموماً با پاسخهای نادرست گره خورده بودند.
- ویژگیهای مرکب و آمیخته (Confounded) که همزمان به هر دو حالت وابستگی داشتند.
سپس محققان برخی از این الگوها را هنگام پاسخدهی مدل غیرفعال (سرکوب) کردند. پاتل این روند را به «چرخاندن پیچهای تنظیمِ درون موتور مدل» تشبیه میکند تا تغییر رفتار آن سنجیده شود.
ویژگیهای مختلف، اثرات متفاوت
نتایج آزمایشها بسیار چشمگیر بود:
- خاموش کردن الگوهای صرفاً مرتبط با نااطمینانی: دقت پاسخها را به شدت کاهش داد؛ نشانهای مبنی بر اینکه تردیدِ محاسبهشده برای اتخاذ استدلال درست لازم است.
- سرکوب الگوهای مرتبط با پاسخهای اشتباه: اثر چندانی در بهبود دقت نگذاشت.
- دستکاری الگوهای آمیخته (نااطمینانی + خطا): نتایج فوقالعادهای رقم زد؛ سرکوب این بخش باعث بهبود دقت تا ۱.۱ درصد و در عین حال کاهش ۷۵ درصدی تردید مدل شد. این دستاورد در ارزیابیها و بنچمارکهای مختلف تکرارپذیر بود.
نکته حائز اهمیت این است که این تغییرات در زمان پاسخدهیِ یک مدلِ از پیشآموزشدیده اعمال میشوند و نیازی به بازآموزی سنگین مدل نیست. پاتل میگوید:
«این متد مانند آن است که پس از ساخته شدن سیستم، ولومِ فعالسازی برخی مدارها را کم یا زیاد کنیم تا به رفتار مطلوب مدنظرمان برسیم.»
سیگنالهای درونی، زنگ خطری برای پاسخهای اشتباه
یکی دیگر از آزمایشها نشان داد که نشانههای درونی حتی میتوانند به سیستم بفهمانند چه زمانی نباید پاسخ دهد. پژوهشگران تنها با زیر نظر گرفتن سه ویژگی از ویژگیهای آمیخته در یک لایه میانیِ مدل لاما (Llama)، توانستند خطای احتمالی سیستم را پیش از اعلام پاسخ پیشبینی کنند.
هنگامی که به مدل دستور داده شد پاسخهایی را که با این الگو همخوانی دارند تحویل ندهد و از آنها صرفنظر کند، دقت پاسخها از ۶۲ درصد به ۸۱ درصد جهش یافت؛ در حالی که همچنان به حدود ۵۳ درصد کل سوالات با اطمینان کامل پاسخ داد.
در مقام مقایسه، اگر به سیستم صرفاً گزینه «نمیدانم» داده میشد تا خودش تصمیم بگیرد، دقت تنها به ۶۴ درصد میرسید. این آزمایش اثبات کرد که یافتهها صرفاً جنبه تئوری ندارند، بلکه راهکاری کاملاً عملی و آماده برای جلوگیری از خطاهای فاحش هوش مصنوعی پیش پای توسعهدهندگان میگذارند.
علاوه بر این، بررسیها ثابت کرد که این قابلیتها محدود به تستهای اولیه نبودهاند و همین ویژگیهای شناساییشده در دیگر بنچمارکها نیز رفتاری مشابه از خود نشان دادند که گواهی بر ماهیت ساختاری این ویژگیها در مدلهای هوش مصنوعی است.
فراتر از درستی و اطمینان
به گفته پاتل، این رویکرد تنها به مقوله درستی یا اعتمادبهنفس پاسخها محدود نخواهد ماند. دانشمندان میتوانند از این تکنیک برای شناسایی ویژگیهای درونی سایر رفتارهای مثبت یا منفی هوش مصنوعی بهره ببرند و تأثیر دستکاری آنها را بسنجند:
«میتوان هر رفتار دلخواه یا ناخوشایند دیگری در هوش مصنوعی را انتخاب کرد، الگوهای درونی متناظر با آن را یافت و سپس با تقویت یا تضعیف همان شاخصها، خروجی مدل را طبق استاندارد دلخواه هدایت کرد.»