کاربر گرامی

برای استفاده از محتوای اختصاصی و ویدئو ها باید در وب سایت هفت صبح ثبت نام نمایید

با ثبت نام و خرید اشتراک به نسخه PDF روزنامه، مطالب و ویدئو‌های اختصاصی و تمامی امکانات دسترسی خواهید داشت.

کدخبر: ۶۰۱۶۳۳۷۸
تاریخ خبر:

برتری بزرگ Gemini ۳.۸ Flash نسبت به GPT-۶ Astra و Claude Fable ۵.۱

برتری بزرگ Gemini 3.8 Flash نسبت به GPT-6 Astra و Claude Fable 5.1

به گزارش هفت صبح گوگل به‌تازگی مدل Gemini 3.8 Flash را منتشر کرده است؛ مدلی که در نگاه اول، ماموریتی دشوار پیش رو دارد: رقابت با GPT-6 Astra (قدرتمندترین مدل OpenAI) و Claude Fable 5.1 (غول جدید Anthropic در حوزه کدنویسی و پروژه‌های طولانی‌مدت).

 

با این حال، یک حوزه مشخص وجود دارد که در آن مدل جدید گوگل بر هر دو رقیب خود برتری مطلق دارد: «درک ویدیو».

 

مدل Gemini 3.8 Flash می‌تواند ویدیو را مستقیماً به عنوان ورودی دریافت کرده و درباره وقایع درون آن استدلال کند. در حالی که GPT-6 Astra از ورودی ویدیو پشتیبانی نمی‌کند و Claude Fable 5.1 نیز همین وضعیت را دارد. شاید این تفاوت جزئی به نظر برسد، اما در عمل، این قابلیت دسته‌ای کاملاً جدید از کاربردها را برای کاربران Gemini باز می‌کند که برای مدل‌های دیگر در دسترس نیست.

 

 جمنای واقعاً می‌تواند ویدیوهای شما را «تماشا» کند

مدل Gemini 3.8 Flash ورودی‌های متنی، تصویری، ویدیویی، صوتی و فایل‌های PDF را با پنجره بافت (Context Window) کمی بیش از یک میلیون توکن می‌پذیرد.

 

موضوع ویدیو بسیار جالب است، زیرا گوگل صرفاً یک کلیپ را به چند اسکرین‌شات تبدیل نمی‌کند تا از جمنای بپرسد در آن‌ها چه می‌گذرد؛ بلکه گوگل از چیزی به نام «درک ویدیویی عامل‌محور» (Agentic Video Understanding) استفاده می‌کند. به جای اینکه مدل کل یک ویدیوی طولانی را با روشی یکسان پردازش کند، می‌تواند در خط زمانی ویدیو پیمایش کند و تصمیم بگیرد برای پاسخ به سوال شما، دقیقاً به کدام بخش از متن (Transcript)، کدام فریم‌ها و کدام بخش‌های صوتی نیاز دارد.

 

گوگل اعلام کرده است که این رویکرد می‌تواند در ویدیوهای طولانی، تا ۸۸ درصد در مصرف توکن‌ها صرفه‌جویی کرده و در عین حال، کیفیت پاسخ‌دهی را حدود ۷ درصد افزایش دهد.

 

این یعنی می‌توانید یک ضبط طولانی را به جمنای بدهید و سوالات بسیار دقیق بپرسید؛ مثلاً: «گوینده در چه زمانی به موضوع خاصی اشاره کرد؟»، «دقیقاً قبل از اینکه شخصی وارد اتاق شود چه اتفاقی افتاد؟» یا «زمانی که درباره فلان نکته صحبت می‌شد، چه چیزی روی صفحه نمایش داده می‌شد؟». جمنای می‌تواند پاسخ‌هایی متصل به لحظات دقیق ویدیو ارائه دهد، بدون اینکه شما مجبور باشید خودتان ویدیو را جلو و عقب کنید.

 

 عدم پشتیبانی بومی در GPT-6 Astra و Claude Fable 5.1

مدل GPT-6 Astra با پنجره بافت کمی بزرگ‌تر (۱.۰۵ میلیون توکن) از متن و تصویر پشتیبانی می‌کند، اما مستندات OpenAI صراحتاً اعلام کرده‌اند که ورودی‌های صوتی و ویدیویی در این مدل پشتیبانی نمی‌شوند.

 

از سوی دیگر، Claude Fable 5.1 با پنجره بافت یک میلیون توکنی، توانایی‌های بینایی خیره‌کننده‌ای در درک نمودارها، جداول و اطلاعات بصری دارد؛ اما محدوده ورودی و خروجی آن تنها به «متن و تصویر» محدود می‌شود. کاربران ممکن است بتوانند فریم‌ها را استخراج کرده یا متن ویدیو را ساخته و سپس به مدل بدهند، اما این یک قابلیت «بومی» (Native) مانند جمنای نیست.

 

 برتری در حوزه صدا

این تفاوت کلیدی در مورد صدا نیز صدق می‌کند. Gemini 3.8 Flash می‌تواند صدا را مستقیماً در کنار سایر ورودی‌ها دریافت کند. این یعنی مدل می‌تواند آنچه را می‌شنود، به عنوان بخشی از یک وظیفه چندوجهی (Multimodal) تحلیل کند، بدون اینکه نیاز باشد ابتدا همه چیز را به متن تبدیل کنید.

 

 نتیجه‌گیری

نکته جالب اینجاست که گوگل این مدل را بزرگترین یا گران‌ترین مدل خود معرفی نکرده است. Gemini 3.8 Flash هوشمندترین مدل از خانواده Flash است که هدف آن ترکیب استدلال پیچیده با سرعت و هزینه بسیار کم است.

 

شاید GPT-6 Astra و Claude Fable 5.1 برای کارهای سنگین‌تر و استدلال‌های پیچیده‌تر انتخاب‌های بهتری باشند، اما با توجه به اینکه ویدیو و صوت بخش مهمی از تعاملات انسانی است، گوگل در این حوزه بر رقبای اصلی خود پیشی گرفته است. برای شروع، کافی است یک ویدیو را آپلود کنید یا لینک آن را در چت قرار دهید و از آن بخواهید آن را تماشا کند.

 

کدخبر: ۶۰۱۶۳۳۷۸
تاریخ خبر:
ارسال نظر