گوگل مدل Gemini 3.6 Flash را با عملکرد ناامیدکننده منتشر کرد

شرکت گوگل به تازگی از مدل هوش مصنوعی جدید خود با نام Gemini 3.6 Flash رونمایی کرده است. با این حال، به نظر می‌رسد زمان‌بندی این معرفی چندان مناسب نبوده است، زیرا درست پس از عرضه مدل‌های متن‌باز و قدرتمند چینی مانند Kimi K3 از شرکت Moonshot انجام می‌شود که علاوه بر کاهش چشمگیر هزینه‌ها، عملکردی در سطح پیشگامان این صنعت ارائه می‌دهند. بسیاری از کارشناسان معتقدند که مدل جدید Google احتمالا ضعیف‌ترین محصول این شرکت تا به امروز به شمار می‌رود.

نتایج Gemini 3.6 Flash در بنچمارک‌های تخصصی

علاوه بر شاخص‌های کلی، نتایج بنچمارک‌های تخصصی نیز تصویر چندان امیدوارکننده‌ای از عملکرد این مدل ارائه نمی‌دهند.

عملکرد در SWE-Bench Pro

در آزمون SWE-Bench Pro که یکی از معتبرترین معیارهای سنجش توانایی مدل‌های هوش مصنوعی در حل مسائل برنامه‌نویسی واقعی محسوب می‌شود، Gemini 3.6 Flash عملکرد ضعیف‌تری نسبت به Grok 4.5 ثبت کرده است.

این موضوع نشان می‌دهد که مدل جدید گوگل در حل باگ‌ها، تحلیل پروژه‌های نرم‌افزاری و تولید کد هنوز با بهترین مدل‌های بازار فاصله دارد.

نتایج MLE Bench

در بنچمارک MLE Bench نیز شرایط چندان متفاوت نیست. نتایج نشان می‌دهد Claude Sonnet 5 با اختلاف قابل توجهی عملکرد بهتری نسبت به Gemini 3.6 Flash ارائه می‌دهد.

این ارزیابی‌ها بیانگر آن هستند که اگرچه Gemini 3.6 Flash از نظر سرعت و هزینه بهینه شده، اما در وظایف پیچیده مبتنی بر استدلال و برنامه‌نویسی هنوز نتوانسته جایگاه قدرتمندی به دست آورد.

معرفی هوش مصنوعی Gemini 3.6 Flash؛ جدیدترین مدل گوگل زیر ذره‌بین

هوش مصنوعی Gemini 3.6 Flash به یک پنجره زمینه با ظرفیت 1 میلیون توکن مجهز شده است. این میزان معادل پردازش 1500 صفحه استاندارد A4 متن، 30000 خط کد برنامه‌نویسی یا یک ساعت محتوای ویدیویی است. هزینه استفاده از این مدل برای هر 1 میلیون توکن خروجی برابر با 7.5 دلار تعیین شده و از ورودی‌های متنوعی شامل متن، تصویر، گفتار و ویدیو پشتیبانی می‌کند. همچنین طبق اعلام Google، این مدل در جریان‌های کاری چندمرحله‌ای، حدود 17 درصد توکن خروجی کمتری مصرف می‌کند.

با وجود این مشخصات، نقطه ضعف اصلی Gemini 3.6 Flash در بخش عملکرد نمایان می‌شود. این مدل در شاخص هوش تحلیلی مصنوعی (Artificial Analysis Intelligence Index) که توانایی‌های عاملی، عمومی، برنامه‌نویسی و استدلال علمی مدل‌های هوش مصنوعی را می‌سنجد، تنها موفق به کسب امتیاز 50 شده است. این نمره نشان‌دهنده عملکردی بسیار ضعیف‌تر در مقایسه با رقبایی نظیر Meta Spark 1.1، مدل GLM-5.2، مدل GPT-5.6 Luna، مدل Sonnet 5، مدل Grok 4.5 و مدل GPT-5.6 Terra است.

مشخصات فنی Gemini 3.6 Flash

بررسی‌های دقیق‌تر روی بنچمارک‌ها نشان می‌دهد که Gemini 3.6 Flash غالبا از مدل‌های قدیمی‌تر و ارزان‌تر شکست می‌خورد. به عنوان مثال، در بنچمارک عمومی SWE-Bench Pro، این محصول عملکرد ضعیف‌تری نسبت به Grok 4.5 دارد که در تاریخ 08 جولای معرفی شده بود. همچنین در ارزیابی MLE Bench، مدل Claude Sonnet 5 به راحتی نماینده گوگل را مغلوب می‌کند.

در کنار این محصول، Google نسخه‌های دیگری را نیز در دسترس قرار داده است. مدل Gemini 3.5 Flash-Lite با توانایی تولید 350 توکن خروجی در ثانیه به عنوان گزینه‌ای مقرون‌به‌صرفه معرفی شده و نسخه Gemini 3.5 Flash Cyber نیز به صورت ویژه برای کاربردهای مرتبط با امنیت سایبری توسعه یافته است.

عملکرد Gemini 3.6 Flash در بنچمارک‌ها

آزمون‌های تخصصی مربوط می‌شود؛ جایی که این محصول نتوانسته نتایج قابل قبولی ثبت کند.

امتیاز پایین در شاخص Artificial Analysis Intelligence Index

Gemini 3.6 Flash در شاخص Artificial Analysis Intelligence Index تنها موفق به کسب امتیاز ۵۰ شده است.

این شاخص، توانایی مدل‌های هوش مصنوعی را در زمینه‌های مختلفی مانند:

  • استدلال منطقی
  • برنامه‌نویسی
  • حل مسائل علمی
  • انجام وظایف عاملی (Agentic Tasks)
  • توانایی‌های عمومی

مورد ارزیابی قرار می‌دهد.

کسب امتیاز ۵۰ باعث شده Gemini 3.6 Flash فاصله محسوسی با بسیاری از مدل‌های مطرح بازار داشته باشد.

مقایسه با رقبا

بر اساس نتایج منتشرشده، Gemini 3.6 Flash از نظر عملکرد پایین‌تر از مدل‌های زیر قرار می‌گیرد:

  • Meta Spark 1.1
  • GLM-5.2
  • GPT-5.6 Luna
  • Claude Sonnet 5
  • Grok 4.5
  • GPT-5.6 Terra

این موضوع نشان می‌دهد که گوگل در نسل جدید مدل Flash بیشتر روی بهینه‌سازی هزینه و سرعت تمرکز کرده و در بخش کیفیت پاسخ‌دهی و استدلال، از رقبای اصلی خود عقب مانده است.

نتایج Gemini 3.6 Flash در بنچمارک‌های تخصصی

علاوه بر شاخص‌های کلی، نتایج بنچمارک‌های تخصصی نیز تصویر چندان امیدوارکننده‌ای از عملکرد این مدل ارائه نمی‌دهند.

عملکرد در SWE-Bench Pro

در آزمون SWE-Bench Pro که یکی از معتبرترین معیارهای سنجش توانایی مدل‌های هوش مصنوعی در حل مسائل برنامه‌نویسی واقعی محسوب می‌شود، Gemini 3.6 Flash عملکرد ضعیف‌تری نسبت به Grok 4.5 ثبت کرده است.

این موضوع نشان می‌دهد که مدل جدید گوگل در حل باگ‌ها، تحلیل پروژه‌های نرم‌افزاری و تولید کد هنوز با بهترین مدل‌های بازار فاصله دارد.

نتایج MLE Bench

در بنچمارک MLE Bench نیز شرایط چندان متفاوت نیست. نتایج نشان می‌دهد Claude Sonnet 5 با اختلاف قابل توجهی عملکرد بهتری نسبت به Gemini 3.6 Flash ارائه می‌دهد.

این ارزیابی‌ها بیانگر آن هستند که اگرچه Gemini 3.6 Flash از نظر سرعت و هزینه بهینه شده، اما در وظایف پیچیده مبتنی بر استدلال و برنامه‌نویسی هنوز نتوانسته جایگاه قدرتمندی به دست آورد.

نسخه‌های جدید دیگر خانواده Gemini

هم‌زمان با معرفی Gemini 3.6 Flash، گوگل چند مدل دیگر را نیز برای کاربران و توسعه‌دهندگان منتشر کرده است.

H3: Gemini 3.5 Flash-Lite

نسخه Gemini 3.5 Flash-Lite به عنوان گزینه‌ای اقتصادی معرفی شده و قادر است تا ۳۵۰ توکن خروجی در ثانیه تولید کند.

این مدل برای کاربردهایی مانند:

  • چت‌بات‌های سازمانی
  • پاسخ‌گویی سریع
  • پردازش حجم بالای درخواست‌ها
  • پروژه‌های کم‌هزینه

طراحی شده است.

H3: Gemini 3.5 Flash Cyber

گوگل همچنین نسخه Gemini 3.5 Flash Cyber را معرفی کرده که به طور اختصاصی برای امنیت سایبری توسعه یافته است.

این مدل می‌تواند در وظایفی مانند:

  • تحلیل تهدیدات امنیتی
  • بررسی آسیب‌پذیری‌ها
  • تحلیل گزارش‌های امنیتی
  • کمک به تیم‌های SOC
  • خودکارسازی فرآیندهای امنیت سایبری

مورد استفاده قرار گیرد.

آیا Gemini 3.6 Flash ارزش استفاده دارد؟

Gemini 3.6 Flash از نظر امکانات فنی، پشتیبانی از ورودی‌های چندرسانه‌ای، پنجره زمینه یک میلیون توکنی و کاهش مصرف توکن، محصولی قابل توجه محسوب می‌شود. با این حال، نتایج بنچمارک‌ها نشان می‌دهد این مدل در زمینه استدلال، برنامه‌نویسی و عملکرد کلی، فاصله قابل توجهی با بسیاری از رقبای مستقیم خود دارد.

به همین دلیل، برای توسعه‌دهندگانی که کیفیت پاسخ، دقت در حل مسائل پیچیده و عملکرد در پروژه‌های حرفه‌ای اولویت اصلی است، مدل‌های رقیب همچنان گزینه‌های جذاب‌تری به شمار می‌روند. در مقابل، سازمان‌هایی که به دنبال کاهش هزینه، سرعت پردازش بالا و پشتیبانی از ورودی‌های متنوع هستند، ممکن است Gemini 3.6 Flash را به عنوان گزینه‌ای مناسب برای برخی سناریوهای کاری در نظر بگیرند.

3 پاسخ

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *