برتری بزرگ Gemini ۳.۸ Flash نسبت به GPT-۶ Astra و Claude Fable ۵.۱
به گزارش هفت صبح گوگل بهتازگی مدل Gemini 3.8 Flash را منتشر کرده است؛ مدلی که در نگاه اول، ماموریتی دشوار پیش رو دارد: رقابت با GPT-6 Astra (قدرتمندترین مدل OpenAI) و Claude Fable 5.1 (غول جدید Anthropic در حوزه کدنویسی و پروژههای طولانیمدت).
با این حال، یک حوزه مشخص وجود دارد که در آن مدل جدید گوگل بر هر دو رقیب خود برتری مطلق دارد: «درک ویدیو».
مدل Gemini 3.8 Flash میتواند ویدیو را مستقیماً به عنوان ورودی دریافت کرده و درباره وقایع درون آن استدلال کند. در حالی که GPT-6 Astra از ورودی ویدیو پشتیبانی نمیکند و Claude Fable 5.1 نیز همین وضعیت را دارد. شاید این تفاوت جزئی به نظر برسد، اما در عمل، این قابلیت دستهای کاملاً جدید از کاربردها را برای کاربران Gemini باز میکند که برای مدلهای دیگر در دسترس نیست.
جمنای واقعاً میتواند ویدیوهای شما را «تماشا» کند
مدل Gemini 3.8 Flash ورودیهای متنی، تصویری، ویدیویی، صوتی و فایلهای PDF را با پنجره بافت (Context Window) کمی بیش از یک میلیون توکن میپذیرد.
موضوع ویدیو بسیار جالب است، زیرا گوگل صرفاً یک کلیپ را به چند اسکرینشات تبدیل نمیکند تا از جمنای بپرسد در آنها چه میگذرد؛ بلکه گوگل از چیزی به نام «درک ویدیویی عاملمحور» (Agentic Video Understanding) استفاده میکند. به جای اینکه مدل کل یک ویدیوی طولانی را با روشی یکسان پردازش کند، میتواند در خط زمانی ویدیو پیمایش کند و تصمیم بگیرد برای پاسخ به سوال شما، دقیقاً به کدام بخش از متن (Transcript)، کدام فریمها و کدام بخشهای صوتی نیاز دارد.
گوگل اعلام کرده است که این رویکرد میتواند در ویدیوهای طولانی، تا ۸۸ درصد در مصرف توکنها صرفهجویی کرده و در عین حال، کیفیت پاسخدهی را حدود ۷ درصد افزایش دهد.
این یعنی میتوانید یک ضبط طولانی را به جمنای بدهید و سوالات بسیار دقیق بپرسید؛ مثلاً: «گوینده در چه زمانی به موضوع خاصی اشاره کرد؟»، «دقیقاً قبل از اینکه شخصی وارد اتاق شود چه اتفاقی افتاد؟» یا «زمانی که درباره فلان نکته صحبت میشد، چه چیزی روی صفحه نمایش داده میشد؟». جمنای میتواند پاسخهایی متصل به لحظات دقیق ویدیو ارائه دهد، بدون اینکه شما مجبور باشید خودتان ویدیو را جلو و عقب کنید.
عدم پشتیبانی بومی در GPT-6 Astra و Claude Fable 5.1
مدل GPT-6 Astra با پنجره بافت کمی بزرگتر (۱.۰۵ میلیون توکن) از متن و تصویر پشتیبانی میکند، اما مستندات OpenAI صراحتاً اعلام کردهاند که ورودیهای صوتی و ویدیویی در این مدل پشتیبانی نمیشوند.
از سوی دیگر، Claude Fable 5.1 با پنجره بافت یک میلیون توکنی، تواناییهای بینایی خیرهکنندهای در درک نمودارها، جداول و اطلاعات بصری دارد؛ اما محدوده ورودی و خروجی آن تنها به «متن و تصویر» محدود میشود. کاربران ممکن است بتوانند فریمها را استخراج کرده یا متن ویدیو را ساخته و سپس به مدل بدهند، اما این یک قابلیت «بومی» (Native) مانند جمنای نیست.
برتری در حوزه صدا
این تفاوت کلیدی در مورد صدا نیز صدق میکند. Gemini 3.8 Flash میتواند صدا را مستقیماً در کنار سایر ورودیها دریافت کند. این یعنی مدل میتواند آنچه را میشنود، به عنوان بخشی از یک وظیفه چندوجهی (Multimodal) تحلیل کند، بدون اینکه نیاز باشد ابتدا همه چیز را به متن تبدیل کنید.
نتیجهگیری
نکته جالب اینجاست که گوگل این مدل را بزرگترین یا گرانترین مدل خود معرفی نکرده است. Gemini 3.8 Flash هوشمندترین مدل از خانواده Flash است که هدف آن ترکیب استدلال پیچیده با سرعت و هزینه بسیار کم است.
شاید GPT-6 Astra و Claude Fable 5.1 برای کارهای سنگینتر و استدلالهای پیچیدهتر انتخابهای بهتری باشند، اما با توجه به اینکه ویدیو و صوت بخش مهمی از تعاملات انسانی است، گوگل در این حوزه بر رقبای اصلی خود پیشی گرفته است. برای شروع، کافی است یک ویدیو را آپلود کنید یا لینک آن را در چت قرار دهید و از آن بخواهید آن را تماشا کند.