کاربر گرامی

برای استفاده از محتوای اختصاصی و ویدئو ها باید در وب سایت هفت صبح ثبت نام نمایید

با ثبت نام و خرید اشتراک به نسخه PDF روزنامه، مطالب و ویدئو‌های اختصاصی و تمامی امکانات دسترسی خواهید داشت.

کدخبر: ۶۰۱۶۶۱۷۷
تاریخ خبر:

هوش مصنوعی چطور پاسخ‌های مشکوک خودش را لو می‌دهد؟

هوش مصنوعی چطور پاسخ‌های مشکوک خودش را لو می‌دهد؟

مدل‌های هوش مصنوعی گاهی اوقات پاسخی کاملاً اشتباه را با اعتمادبه‌نفسی باورنکردنی تحویل کاربر می‌دهند.

به گزارش هفت صبح در نقطه‌ی مقابل، در مواردی هم دیده می‌شود که این مدل‌ها احتیاط به خرج می‌دهند و می‌گویند مطمئن نیستند، در حالی که پاسخ‌شان کاملاً درست است.

اکنون پژوهشی تازه به سرپرستی دانشمندان علوم کامپیوتر در دانشگاه کالیفرنیا، ریورساید (UCR)، پرده از علت این معما برمی‌دارد. پژوهشگران دریافته‌اند که «میزان اطمینان مدل» و «صحت پاسخ آن» از بخش‌ها و الگوهای درونی متفاوتی در مدل‌های زبانی بزرگ سرچشمه می‌گیرند؛ یافته‌ای که فرض رایج پیشین را به چالش می‌کشد؛ فرضی که ادعا می‌کرد لحن مطمئن یک مدل، نشانه‌ای حتمی از درست بودن پاسخ آن است.

این کشف که در پایگاه مقالات پیش‌انتشار arXiv منتشر شده، می‌تواند گامی کلیدی در ساخت هوش مصنوعی قابل‌اعتمادتر باشد. هم‌زمان با گسترش روزافزون نقش مدل‌های زبانی در تصمیم‌گیری‌های حیاتی و انجام امور مختلف، توسعه‌دهندگان بیش از هر زمان دیگری به ابزارهایی نیاز دارند تا مرز میان پاسخ‌های مطمئن و نامعتبر را تشخیص دهند.

محققان با تفکیک و شناسایی ویژگی‌های درونیِ مرتبط با «اطمینان» از ویژگی‌های مربوط به «درستی»، به راهکاری دست یافته‌اند که می‌تواند رفتار هوش مصنوعی را تنظیم کند: سیستم در زمان پاسخ‌های درست با اطمینان صحبت کند و در شرایطی که احتمال خطا وجود دارد، با احتیاط عمل نماید.

هت پاتل (Het Patel)، دانشجوی دکترای علوم کامپیوتر در UCR و نویسنده اصلی مقاله، در این‌باره می‌گوید:

«فرض اصلی در این حوزه همیشه این بوده که وقتی مدل با اعتمادبه‌نفس سخن می‌گوید احتمالاً پاسخ درست است، و هرگاه ابراز تردید کند احتمال خطا بیشتر خواهد بود. با این حال، موارد نقض بی‌شماری ثبت شده است؛ مدلی که با قاطعیت پاسخی غلط ارائه می‌دهد، یا پاسخی کاملاً درست که با تردید و تزلزل تحویل داده می‌شود.»

تیم پژوهشی فراتر از صرفِ ثبت این ناهماهنگی پیش رفت. آن‌ها ویژگی‌های درونی متناظر با هر دو مؤلفه را پیدا کردند و نشان دادند که با دستکاریِ هدفمند برخی از آن‌ها، می‌توان رفتار هوش مصنوعی را بدون نیاز به فرآیند پرهزینه و طاقت‌فرسای بازآموزیِ کل مدل (Retraining)، اصلاح کرد.


تفکیک «اطمینان» از «صحت پاسخ»

پاتل توضیح می‌دهد که مدل‌های هوش مصنوعی امروزی از طریق آموزش شبکه‌های عظیم ریاضی روی اقیانوسی از داده‌ها خلق می‌شوند. در طول این آموزش، شبکه میلیاردها پارامتر عددی (که به اصطلاح وزن یا Weights نامیده می‌شوند) را مرتباً تغییر می‌دهد تا الگوها را بیاموزد. در یک مدل زبانی، همین الگوهای یادگرفته‌شده امکان پیش‌بینی کلمات بعدی و در نهایت تولید جملات پاسخ را رقم می‌زنند.

پرسش اصلی تیم پاتل این بود: وقتی بین «اطمینان کلامی مدل» و «صحت علمی پاسخ» شکاف وجود دارد، در درون شبکه عصبی دقیقاً چه اتفاقی رخ می‌دهد؟

آن‌ها دو مدل زبانی متن‌باز و در دسترس شامل Llama-3.1-8B متا و Gemma-2-9B گوگل را بررسی کردند؛ مدل‌هایی که به محققان اجازه می‌دهند کارکرد درونی آن‌ها را به دقت واکاوی کنند. پژوهشگران با استفاده از پرسش‌های چهارگزینه‌ای، خروجی‌ها را به چهار دسته بخش‌بندی کردند:

  1. درست و بااطمینان
  2. درست اما با تردید
  3. اشتباه و بااطمینان
  4. اشتباه و همراه با تردید

سپس با ابزاری موسوم به Sparse Autoencoders سیگنال‌ها و فعالیت‌های داخلی شبکه را زیر ذره‌بین قرار دادند تا ببینند هنگام بروز هر رفتار، دقیقاً کدام ویژگی‌ها و گره‌ها در مدل فعال می‌شوند.

این تحلیل سه دسته الگو و ویژگی درونی را آشکار کرد:

  • ویژگی‌هایی که صرفاً با تردید و نااطمینانی مرتبط بودند.
  • ویژگی‌هایی که عموماً با پاسخ‌های نادرست گره خورده بودند.
  • ویژگی‌های مرکب و آمیخته (Confounded) که هم‌زمان به هر دو حالت وابستگی داشتند.

سپس محققان برخی از این الگوها را هنگام پاسخ‌دهی مدل غیرفعال (سرکوب) کردند. پاتل این روند را به «چرخاندن پیچ‌های تنظیمِ درون موتور مدل» تشبیه می‌کند تا تغییر رفتار آن سنجیده شود.


ویژگی‌های مختلف، اثرات متفاوت

نتایج آزمایش‌ها بسیار چشمگیر بود:

  • خاموش کردن الگوهای صرفاً مرتبط با نااطمینانی: دقت پاسخ‌ها را به شدت کاهش داد؛ نشانه‌ای مبنی بر اینکه تردیدِ محاسبه‌شده برای اتخاذ استدلال درست لازم است.
  • سرکوب الگوهای مرتبط با پاسخ‌های اشتباه: اثر چندانی در بهبود دقت نگذاشت.
  • دستکاری الگوهای آمیخته (نااطمینانی + خطا): نتایج فوق‌العاده‌ای رقم زد؛ سرکوب این بخش باعث بهبود دقت تا ۱.۱ درصد و در عین حال کاهش ۷۵ درصدی تردید مدل شد. این دستاورد در ارزیابی‌ها و بنچمارک‌های مختلف تکرارپذیر بود.

نکته حائز اهمیت این است که این تغییرات در زمان پاسخ‌دهیِ یک مدلِ از پیش‌آموزش‌دیده اعمال می‌شوند و نیازی به بازآموزی سنگین مدل نیست. پاتل می‌گوید:

«این متد مانند آن است که پس از ساخته شدن سیستم، ولومِ فعال‌سازی برخی مدارها را کم یا زیاد کنیم تا به رفتار مطلوب مدنظرمان برسیم.»


سیگنال‌های درونی، زنگ خطری برای پاسخ‌های اشتباه

یکی دیگر از آزمایش‌ها نشان داد که نشانه‌های درونی حتی می‌توانند به سیستم بفهمانند چه زمانی نباید پاسخ دهد. پژوهشگران تنها با زیر نظر گرفتن سه ویژگی از ویژگی‌های آمیخته در یک لایه میانیِ مدل لاما (Llama)، توانستند خطای احتمالی سیستم را پیش از اعلام پاسخ پیش‌بینی کنند.

هنگامی که به مدل دستور داده شد پاسخ‌هایی را که با این الگو همخوانی دارند تحویل ندهد و از آن‌ها صرف‌نظر کند، دقت پاسخ‌ها از ۶۲ درصد به ۸۱ درصد جهش یافت؛ در حالی که همچنان به حدود ۵۳ درصد کل سوالات با اطمینان کامل پاسخ داد.

در مقام مقایسه، اگر به سیستم صرفاً گزینه «نمی‌دانم» داده می‌شد تا خودش تصمیم بگیرد، دقت تنها به ۶۴ درصد می‌رسید. این آزمایش اثبات کرد که یافته‌ها صرفاً جنبه تئوری ندارند، بلکه راهکاری کاملاً عملی و آماده برای جلوگیری از خطاهای فاحش هوش مصنوعی پیش پای توسعه‌دهندگان می‌گذارند.

علاوه بر این، بررسی‌ها ثابت کرد که این قابلیت‌ها محدود به تست‌های اولیه نبوده‌اند و همین ویژگی‌های شناسایی‌شده در دیگر بنچمارک‌ها نیز رفتاری مشابه از خود نشان دادند که گواهی بر ماهیت ساختاری این ویژگی‌ها در مدل‌های هوش مصنوعی است.


فراتر از درستی و اطمینان

به گفته پاتل، این رویکرد تنها به مقوله درستی یا اعتمادبه‌نفس پاسخ‌ها محدود نخواهد ماند. دانشمندان می‌توانند از این تکنیک برای شناسایی ویژگی‌های درونی سایر رفتارهای مثبت یا منفی هوش مصنوعی بهره ببرند و تأثیر دستکاری آن‌ها را بسنجند:

«می‌توان هر رفتار دلخواه یا ناخوشایند دیگری در هوش مصنوعی را انتخاب کرد، الگوهای درونی متناظر با آن را یافت و سپس با تقویت یا تضعیف همان شاخص‌ها، خروجی مدل را طبق استاندارد دلخواه هدایت کرد.»

کدخبر: ۶۰۱۶۶۱۷۷
تاریخ خبر:
ارسال نظر