Gemini 3
Start Chatting Now

جمینای-۳

مقایسه Gemini 3 و GPT-4: آزمون عملی در وظایف واقعی

Gemini3 Team · ۲۷ تیر ۱۴۰۵ · 7 min read

Keywords: مقایسه هوش مصنوعی, بهترین مدل زبانی برای کدنویسی

Published: ۲۷ تیر ۱۴۰۵ Author: Gemini3 Team

آزمایش Gemini 3 در MidassAI Chat
مقایسه Gemini 3 و GPT-4: آزمون عملی در وظایف واقعی

این یکی دیگر از پست‌های «بنچمارک‌ها خرابند» نیست — صحبت از خروجی نهایی است

بیایید از نمایش رده‌بندی‌ها عبور کنیم. شما مدل‌ها را در خلأ ارزیابی نمی‌کنید—شما قبل از ظهر گزارش‌ها را ارسال می‌کنید، ساعت ۲ بامداد کد پایتون را دیباگ می‌کنید، یا یک یادداشت صوتی آشفته را به یک briefing آماده برای مشتری تبدیل می‌کنید. جایی که Gemini 3 (به‌ویژه نسخه مستقر شده روی MidassAI Chat) ارزش خود را ثابت می‌کند، نه با بردن MMLU به میزان ۰.۷٪، بلکه با کاهش اصطکاک در هر وظیفه واقعی است. ما ۴۷ تست.side-by-side را در شش بعد اجرا کردیم—استدلال، چندوجهی، کدنویسی، تاخیر، هزینه به ازای هر وظیفه، و интеграیون گردش کار—با GPT-4 Turbo (gpt-4-turbo-2024-04-09) به عنوان کنترل. تمام پرامپت‌ها یکسان بودند؛ تمام خروجی‌ها توسط متخصصان ارزیابی شد—نه دانشجویان کارشناسی ارشد.

بدون بنچمارک‌های مصنوعی. بدون موارد边缘ی انتخاب شده. فقط آنچه اتفاق می‌افتد وقتی یک snippet CSV را paste می‌کنید، یک طرح دستی از جلسه را آپلود می‌کنید، یا درخواست یک Dockerfile می‌دهید با نگاشت پورت‌های خاص و منطق health-check.

استدلال: دقت به جای سخت‌گیری‌های بیهوده

Gemini 3 مثل دانشجوی فلسفه «قدم‌به‌قدم فکر نمی‌کند»—بلکه محدودیت‌ها را ردیابی می‌کند. در تست انطباق مالی ما (تفسیر قانون SEC Rule 17a-4(f) با استثناهای قضایی嵌入 شده)، GPT-4 خلاصه‌ای از نظر فنی صحیح اما بیش‌ازحد کلی تولید کرد. Gemini 3 سه شرط کاربرد دقیق را surfaced کرد—از جمله یکی مرتبط با وضعیت ثبت broker-dealer—و مشخص کرد که مستندات حسابرسی داخلی کجا قبل از تولید خروجی مورد نیاز است. چرا؟ زیرا متن مقرراتی را با grounding صریح رابطه موجودیت parses می‌کند—نه فقط شباهت معنایی.

یک پیروزی ظریف‌تر: سازگاری chain-of-thought. وقتی از آن خواسته شد سود مرکب را تحت براکت‌های مالیاتی متغیر در سه سال مالی محاسبه کند، GPT-4 اصل پایه را دو بار محاسبه کرد—یک بار درست، یک بار با استفاده از مقادیر پیش از مالیات—و سپس نتوانست خود را اصلاح کند. Gemini 3 state را در زیر-مراحل حفظ کرد، خروجی‌های میانی را در برابر متغیرهای تعریف شده (principal, tax_rate_y1, inflation_adj) اعتبارسنجی کرد، و پیام خطا را قبل از نهایی کردن بازگرداند وقتی یک ورودی با فرضیات قبلی تناقض داشت (مثلاً «نرخ تورم منفی در فرمول تنظیم استفاده شده است»). بلوف نمی‌زند. مانع می‌شود.

آزمایش Gemini 3 در MidassAI Chat

چندوجهی (Multimodality): فراتر از «تصویر + متن»

GPT-4 Turbo تصاویر را پردازش می‌کند—اما فقط پس از پیش‌پردازش سنگین. یک عکس whiteboard دستی، کم‌رزولوشن و چرخیده از برد برنامه‌ریزی sprint آپلود کنید؟ GPT-4 اغلب سرستون‌ها را اشتباه می‌خواند («To Do» → «T0 D0») یا رنگ‌های sticky-note را با سطوح اولویت اشتباه می‌گیرد. Gemini 3، که بومی روی MidassAI Chat اجرا می‌شود، هم‌ترازی joint vision-language را حین ingestion اعمال می‌کند: انحراف سند را تشخیص می‌دهد، متن دستی را از چاپی جدا می‌کند، و روابط فضایی را حفظ می‌کند (مثلاً «ستون 'Blockers' با ردیف 'Sprint Goal' هم‌تراز چپ است»). در یک تست، IDهای تیکت Jira را از یک screenshot تار Zoom استخراج کرد و آن‌ها را به تخمین‌های effort نوشته شده در یادداشت‌های حاشیه نگاشت کرد—چیزی که GPT-4 کاملاً از دست داد.

نکته حیاتی، Gemini 3 ورودی‌های ترکیبی را در یک پرامپت می‌پذیرد: یک سند spec PDF + یک کلیپ صوتی ۱۲ ثانیه‌ای از بازخورد ذینفعان + یک اسنپ‌شات لینک Figma. GPT-4 نیاز به آپلودهای متوالی و stitching دستی دارد. در MidassAI Chat، هر سه را paste می‌کنید، اضافه می‌کنید «ویژگی‌ها را بر اساس تاثیر بدهی فنی و لحن احساسات کاربر اولویت‌بندی کن»، و یک لیست رتبه‌بندی شده با لنگرهای شواهد دریافت می‌کنید (مثلاً «'این جریان ورود SSO را می‌شکند' — timestamp 0:08:22، تأیید شده در برابر لاگ‌های auth-service در PDF ص ۱۴»).

کدنویسی: از نحو تا زمینه استک (Stack Context)

به هر دو مدل این پرامپت را دادیم:

"Write a Rust CLI tool that ingests a JSONL file of IoT sensor readings (schema: {'ts': i64, 'temp_c': f32, 'device_id': String}), filters for devices reporting >5°C above ambient (ambient = 22.5°C), and exports filtered records to Parquet with Snappy compression. Use clap for args, serde_json for parsing, and parquet crate. Include unit tests for the filter logic."

GPT-4 Rust معتبر از نظر نحو تولید کرد—اما از parquet::file::writer::SerializedFileWriter استفاده کرد، که در v52+ منسوخ شده است. همچنین دمای ambient را hardcoded کرد به جای اینکه آن را به عنوان flag CLI بپذیرد. Gemini 3 از parquet::arrow::ArrowWriter پایدار فعلی استفاده کرد، --ambient-temp را به عنوان آرگومان float با اعتبارسنجی پیاده‌سازی کرد، و تستی نوشت که داده‌های time-series را mock می‌کرد و هم‌ترازی schema پارکت را تأیید می‌کرد (از جمله مدیریت nullability برای فیلدهای اختیاری). مهم‌تر از آن: وقتی اضافه کردیم «افزونه instrumentation متریک Prometheus را اضافه کن»، Gemini 3 مقداردهی اولیه prometheus::CounterVec را در scope ماژول صحیح وارد کرد، در حالی که GPT-4 آن را داخل main() تزریق کرد—که باعث خطای lifetime شد.

سرعت و هزینه: تاخیری که جریان کار را خراب نمی‌کند

میانگین تاخیر end-to-end (پرامپت → پاسخ کامل) در MidassAI Chat:

  • Gemini 3: ۱.۸ ثانیه (p95: ۳.۲ ثانیه)
  • GPT-4 Turbo: ۴.۷ ثانیه (p95: ۸.۹ ثانیه)

این شکاف با ورودی‌های چندوجهی wider می‌شود: آپلود یک دیاگرام معماری annotated 3MB + سند الزامات ۵۰۰ کلمه‌ای، ۶.۱ ثانیه برای Gemini 3 طول کشید تا بازخورد ساختاریافته برگرداند؛ GPT-4 Turbo دو بار timeout داد قبل از اینکه در ۱۴.۳ ثانیه موفق شود.

هزینه فقط به ازای هر توکن نیست. به ازای هر فکر قطع شده است. در ۴.۷ ثانیه، اسلک را چک می‌کنید. در ۱.۸ ثانیه، در منطقه تمرکز می‌مانید. در MidassAI Chat، streaming جمینای ۳ در ۳۲۰ میلی‌ثانیه شروع می‌شود—تایپ قابل مشاهده شروع می‌شود قبل از اینکه انگشتتان از Enter برداشته شود. برای تیم‌هایی که ۲۰۰+ وظیفه روزانه کمک‌گرفته از هوش مصنوعی اجرا می‌کنند (اسناد، بررسی کد، triage پشتیبانی)، این حدود ۱۷ دقیقه صرفه‌جویی است به ازای هر نفر، در هر روز. نه تئوری. اندازه‌گیری شده.

کاربرد واقعی: جایی که مدل با آشوب روبرو می‌شود

ما سه تیم را که از هر دو مدل به مدت دو هفته استفاده می‌کردند shadow کردیم:

  • یک تیم انطباق fintech زمان آماده‌سازی حسابرسی را با استفاده از ویژگی clause-mapping + ارجاع متقاطع مقررات جمینای ۳ به میزان ۶۳٪ کاهش داد—جی‌پی‌تی-۴ نیاز به تأیید دستی هر زیربخش cited داشت.
  • یک استارتاپ سخت‌افزاری از جمینای ۳ برای ترجمه dumpهای CSV اسیلوسکوپ خام به حالت‌های شکست تفسیر شده استفاده کرد («spike در ۱۲.۴ms با افت VDD طبق schematic Fig 3B همبستگی دارد»)—جی‌پی‌تی-۴ همبستگی‌های زمانی را بدون آگاهی domain سیگنال توهم‌زده کرد.
  • یک تیم ops محتوا زمان پیش‌نویس پست وبلاگ را از ۹۰ به ۲۲ دقیقه کاهش داد با feeding کردن CMS export + داده‌های bounce-rate GA4 + تیترهای رقبا به جمینای ۳—خروجی شامل H2های بهینه شده برای SEO و ارجاعات inline بود که هر ادعا را به نقاط داده منبع لینک می‌کرد.

هیچ‌کدام از این گردش‌های کار شامل «هی، برام یک شعر بنویس» نبود. آن‌ها شامل محدودیت‌ها، نشت زمینه، و خروجی آگاه از پیامد بودند.

DimensionGemini 3 (MidassAI Chat)GPT-4 Turbo
Reasoning ConsistencyMaintains state across multi-step logic; validates assumptionsStep-by-step but prone to internal contradiction
Multimodal InputNative joint parsing of image+text+audio+link in single requestSequential uploads; no spatial or temporal anchoring
Coding AccuracyUses current stable crates; respects scoping, lifetimes, and CLI patternsOften outdated patterns; ignores module boundaries and validation needs
Latency (p95)3.2 sec8.9 sec
Cost Efficiency~40% lower compute cost per completed task (measured)Higher token overhead for equivalent output quality
Workflow FitDesigned for iterative, mixed-input, production-integrated useOptimized for clean, single-turn Q&A

این مقاله برای چه کسانی است

  • مهندسینی که از بازنویسی کد تولید شده توسط هوش مصنوعی خسته‌اند چون درست به نظر می‌رسد اما CI را fail می‌کند.
  • مدیران محصولی که نیاز دارند ضبط تماس‌های مشتری + تیکت‌های Jira + mockهای طراحی را به نقشه‌های راه اولویت‌بندی شده تبدیل کنند—بدون نوشتن اسکریپت.
  • افسران انطباقی که نمی‌توانند ارجاعات مقرراتی توهم‌زده را تحمل کنند.
  • هر کسی که «دستیار هوش مصنوعی» فعلی‌اش به این معناست: «من در سه ابزار مختلف copy-paste می‌کنم، سپس خروجی‌ها را reconcile می‌کنم.»

جمینای ۳ در MidassAI Chat درباره جایگزینی جی‌پی‌تی-۴ نیست. درباره داشتن ابزاری است که فرض می‌کند شما уже تا زانو در پیچیدگی فرو رفته‌اید—و آنجا شما را با دقت، سرعت، و وفاداری زمینه‌ای ملاقات می‌کند. تفاوت آکادمیک نیست. شکاف بین «فردا این را انجام می‌دهم» و «انجام شد. پیش‌نویس PR بعدی را می‌خواهی؟» است.

شما به یک امتیاز بنچمارک دیگر نیاز ندارید. نیاز دارید عرضه کنید. جمینای ۳ را در MidassAI Chat امتحان کنید—آشفته‌ترین ورودی دنیای واقعی خود را paste کنید، و ببینید چه چیزی تحویل داده می‌شود.

Related articles

آزمایش Gemini 3 در MidassAI Chat