شرکت گوگل به تازگی از مدل هوش مصنوعی جدید خود با نام Gemini 3.6 Flash رونمایی کرده است. با این حال، به نظر میرسد زمانبندی این معرفی چندان مناسب نبوده است، زیرا درست پس از عرضه مدلهای متنباز و قدرتمند چینی مانند Kimi K3 از شرکت Moonshot انجام میشود که علاوه بر کاهش چشمگیر هزینهها، عملکردی در سطح پیشگامان این صنعت ارائه میدهند. بسیاری از کارشناسان معتقدند که مدل جدید Google احتمالا ضعیفترین محصول این شرکت تا به امروز به شمار میرود.
نتایج Gemini 3.6 Flash در بنچمارکهای تخصصی
علاوه بر شاخصهای کلی، نتایج بنچمارکهای تخصصی نیز تصویر چندان امیدوارکنندهای از عملکرد این مدل ارائه نمیدهند.
عملکرد در SWE-Bench Pro
در آزمون SWE-Bench Pro که یکی از معتبرترین معیارهای سنجش توانایی مدلهای هوش مصنوعی در حل مسائل برنامهنویسی واقعی محسوب میشود، Gemini 3.6 Flash عملکرد ضعیفتری نسبت به Grok 4.5 ثبت کرده است.
این موضوع نشان میدهد که مدل جدید گوگل در حل باگها، تحلیل پروژههای نرمافزاری و تولید کد هنوز با بهترین مدلهای بازار فاصله دارد.
نتایج MLE Bench
در بنچمارک MLE Bench نیز شرایط چندان متفاوت نیست. نتایج نشان میدهد Claude Sonnet 5 با اختلاف قابل توجهی عملکرد بهتری نسبت به Gemini 3.6 Flash ارائه میدهد.
این ارزیابیها بیانگر آن هستند که اگرچه Gemini 3.6 Flash از نظر سرعت و هزینه بهینه شده، اما در وظایف پیچیده مبتنی بر استدلال و برنامهنویسی هنوز نتوانسته جایگاه قدرتمندی به دست آورد.
معرفی هوش مصنوعی Gemini 3.6 Flash؛ جدیدترین مدل گوگل زیر ذرهبین
هوش مصنوعی Gemini 3.6 Flash به یک پنجره زمینه با ظرفیت 1 میلیون توکن مجهز شده است. این میزان معادل پردازش 1500 صفحه استاندارد A4 متن، 30000 خط کد برنامهنویسی یا یک ساعت محتوای ویدیویی است. هزینه استفاده از این مدل برای هر 1 میلیون توکن خروجی برابر با 7.5 دلار تعیین شده و از ورودیهای متنوعی شامل متن، تصویر، گفتار و ویدیو پشتیبانی میکند. همچنین طبق اعلام Google، این مدل در جریانهای کاری چندمرحلهای، حدود 17 درصد توکن خروجی کمتری مصرف میکند.
با وجود این مشخصات، نقطه ضعف اصلی Gemini 3.6 Flash در بخش عملکرد نمایان میشود. این مدل در شاخص هوش تحلیلی مصنوعی (Artificial Analysis Intelligence Index) که تواناییهای عاملی، عمومی، برنامهنویسی و استدلال علمی مدلهای هوش مصنوعی را میسنجد، تنها موفق به کسب امتیاز 50 شده است. این نمره نشاندهنده عملکردی بسیار ضعیفتر در مقایسه با رقبایی نظیر Meta Spark 1.1، مدل GLM-5.2، مدل GPT-5.6 Luna، مدل Sonnet 5، مدل Grok 4.5 و مدل GPT-5.6 Terra است.
مشخصات فنی Gemini 3.6 Flash
بررسیهای دقیقتر روی بنچمارکها نشان میدهد که Gemini 3.6 Flash غالبا از مدلهای قدیمیتر و ارزانتر شکست میخورد. به عنوان مثال، در بنچمارک عمومی SWE-Bench Pro، این محصول عملکرد ضعیفتری نسبت به Grok 4.5 دارد که در تاریخ 08 جولای معرفی شده بود. همچنین در ارزیابی MLE Bench، مدل Claude Sonnet 5 به راحتی نماینده گوگل را مغلوب میکند.
در کنار این محصول، Google نسخههای دیگری را نیز در دسترس قرار داده است. مدل Gemini 3.5 Flash-Lite با توانایی تولید 350 توکن خروجی در ثانیه به عنوان گزینهای مقرونبهصرفه معرفی شده و نسخه Gemini 3.5 Flash Cyber نیز به صورت ویژه برای کاربردهای مرتبط با امنیت سایبری توسعه یافته است.
عملکرد Gemini 3.6 Flash در بنچمارکها
آزمونهای تخصصی مربوط میشود؛ جایی که این محصول نتوانسته نتایج قابل قبولی ثبت کند.
امتیاز پایین در شاخص Artificial Analysis Intelligence Index
Gemini 3.6 Flash در شاخص Artificial Analysis Intelligence Index تنها موفق به کسب امتیاز ۵۰ شده است.
این شاخص، توانایی مدلهای هوش مصنوعی را در زمینههای مختلفی مانند:
- استدلال منطقی
- برنامهنویسی
- حل مسائل علمی
- انجام وظایف عاملی (Agentic Tasks)
- تواناییهای عمومی
مورد ارزیابی قرار میدهد.
کسب امتیاز ۵۰ باعث شده Gemini 3.6 Flash فاصله محسوسی با بسیاری از مدلهای مطرح بازار داشته باشد.
مقایسه با رقبا
بر اساس نتایج منتشرشده، Gemini 3.6 Flash از نظر عملکرد پایینتر از مدلهای زیر قرار میگیرد:
- Meta Spark 1.1
- GLM-5.2
- GPT-5.6 Luna
- Claude Sonnet 5
- Grok 4.5
- GPT-5.6 Terra
این موضوع نشان میدهد که گوگل در نسل جدید مدل Flash بیشتر روی بهینهسازی هزینه و سرعت تمرکز کرده و در بخش کیفیت پاسخدهی و استدلال، از رقبای اصلی خود عقب مانده است.
نتایج Gemini 3.6 Flash در بنچمارکهای تخصصی
علاوه بر شاخصهای کلی، نتایج بنچمارکهای تخصصی نیز تصویر چندان امیدوارکنندهای از عملکرد این مدل ارائه نمیدهند.
عملکرد در SWE-Bench Pro
در آزمون SWE-Bench Pro که یکی از معتبرترین معیارهای سنجش توانایی مدلهای هوش مصنوعی در حل مسائل برنامهنویسی واقعی محسوب میشود، Gemini 3.6 Flash عملکرد ضعیفتری نسبت به Grok 4.5 ثبت کرده است.
این موضوع نشان میدهد که مدل جدید گوگل در حل باگها، تحلیل پروژههای نرمافزاری و تولید کد هنوز با بهترین مدلهای بازار فاصله دارد.
نتایج MLE Bench
در بنچمارک MLE Bench نیز شرایط چندان متفاوت نیست. نتایج نشان میدهد Claude Sonnet 5 با اختلاف قابل توجهی عملکرد بهتری نسبت به Gemini 3.6 Flash ارائه میدهد.
این ارزیابیها بیانگر آن هستند که اگرچه Gemini 3.6 Flash از نظر سرعت و هزینه بهینه شده، اما در وظایف پیچیده مبتنی بر استدلال و برنامهنویسی هنوز نتوانسته جایگاه قدرتمندی به دست آورد.
نسخههای جدید دیگر خانواده Gemini
همزمان با معرفی Gemini 3.6 Flash، گوگل چند مدل دیگر را نیز برای کاربران و توسعهدهندگان منتشر کرده است.
H3: Gemini 3.5 Flash-Lite
نسخه Gemini 3.5 Flash-Lite به عنوان گزینهای اقتصادی معرفی شده و قادر است تا ۳۵۰ توکن خروجی در ثانیه تولید کند.
این مدل برای کاربردهایی مانند:
- چتباتهای سازمانی
- پاسخگویی سریع
- پردازش حجم بالای درخواستها
- پروژههای کمهزینه
طراحی شده است.
H3: Gemini 3.5 Flash Cyber
گوگل همچنین نسخه Gemini 3.5 Flash Cyber را معرفی کرده که به طور اختصاصی برای امنیت سایبری توسعه یافته است.
این مدل میتواند در وظایفی مانند:
- تحلیل تهدیدات امنیتی
- بررسی آسیبپذیریها
- تحلیل گزارشهای امنیتی
- کمک به تیمهای SOC
- خودکارسازی فرآیندهای امنیت سایبری
مورد استفاده قرار گیرد.
آیا Gemini 3.6 Flash ارزش استفاده دارد؟
Gemini 3.6 Flash از نظر امکانات فنی، پشتیبانی از ورودیهای چندرسانهای، پنجره زمینه یک میلیون توکنی و کاهش مصرف توکن، محصولی قابل توجه محسوب میشود. با این حال، نتایج بنچمارکها نشان میدهد این مدل در زمینه استدلال، برنامهنویسی و عملکرد کلی، فاصله قابل توجهی با بسیاری از رقبای مستقیم خود دارد.
به همین دلیل، برای توسعهدهندگانی که کیفیت پاسخ، دقت در حل مسائل پیچیده و عملکرد در پروژههای حرفهای اولویت اصلی است، مدلهای رقیب همچنان گزینههای جذابتری به شمار میروند. در مقابل، سازمانهایی که به دنبال کاهش هزینه، سرعت پردازش بالا و پشتیبانی از ورودیهای متنوع هستند، ممکن است Gemini 3.6 Flash را به عنوان گزینهای مناسب برای برخی سناریوهای کاری در نظر بگیرند.





3 پاسخ
مقاله فوقالعاده
ممنون از نظر شما
مقاله جذابی بود