
Gemini 3.7 Flash: hạng 23 vẫn là đủ
Gemini 3.7 Flash: hạng 23 vẫn là đủ
Hai bảng điểm, cùng một model, cùng một tuần.
Trên trang ra mắt của Google, Gemini 3.7 Flash nằm ở hoặc sát đỉnh mọi hạng mục liên quan tới việc của agent: chất lượng code chuyên nghiệp, kỹ nghệ phần mềm dài hạn, phát triển web, xử lý PDF, tự động hoá cấp doanh nghiệp. Thỉnh thoảng có đối thủ vượt lên. Phần lớn là nó dẫn.
Trên arena.ai — bảng xếp hạng độc lập dựng từ các phiên làm việc thật chứ không phải từ bài đánh giá của chính nhà sản xuất — vẫn model đó xếp thế này:
| Hạng mục | Gemini 3.7 Flash |
|---|---|
| Tổng thể | hạng 21 |
| Code | hạng 23 |
| Work | hạng 24 |
| Chat | hạng 11 |
Model đầu bảng của Anthropic giữ vị trí số một ở cả bốn hạng mục.
Không bảng nào nói dối cả. Câu hỏi thú vị là làm gì với một model mà nhà sản xuất gọi là tốt nhất phân khúc còn bảng độc lập xếp thứ hai mươi ba — và câu trả lời chỉ lộ ra khi bạn thật sự dựng một thứ gì đó bằng nó.
Về bài viết này
Viết từ video trên kênh. Hai lần dựng, các mốc thời gian, vị trí trên bảng xếp hạng và số quota tiêu thụ là những gì diễn ra trên màn hình. Giá và vị trí benchmark lấy từ trang ra mắt của Google và được ghi rõ như vậy. Vài tên sản phẩm trong phụ đề tự động sai quá nặng nên mình mô tả thay vì đoán bừa.
Giá thật là bao nhiêu
Trang ra mắt để Gemini 3.7 Flash ở mức khoảng 0,75 đô mỗi triệu token input và 3,75 đô mỗi triệu token output. Đó là con số của hãng, không phải con số đo được, nhưng nó dựng nên toàn bộ lập luận phía sau.
Video cũng đi qua một biểu đồ chi phí cho mỗi đầu việc, so sánh cùng một tác vụ agent chạy dài qua các thế hệ model — khoảng 15 đô ở phân khúc đầu bảng, khoảng 8 đô ở bản Flash cách đây hai đời, khoảng 4 đô ở đời trước, và chưa tới một đô ở đây. Hãy đọc nó như một xu hướng, đừng đọc như một con số mang về dùng: đó là biểu đồ của hãng, và tác vụ cũng là của hãng.
Thứ còn lại từ một biểu đồ của hãng chỉ là hình dạng: điều đáng chú ý không phải rẻ hơn, mà là rẻ hơn cả một bậc độ lớn mà vẫn còn nằm trong cùng cuộc trò chuyện về năng lực.
Hai lần dựng, mỗi lần một prompt
Cả hai chạy theo cùng một cách: một prompt, ba sub-agent, không đỡ tay giữa các bước.
Prompt yêu cầu đúng ba thứ — một agent backend viết API và logic, một agent frontend dựng giao diện gọi vào đó, và một agent QA chạy thử sản phẩm rồi trả lỗi ngược lại — test suite cho web app, bot tự chơi cho game. Quy tắc điều phối mới là chỗ đáng học: kích hoạt hai cái đầu cùng lúc, giữ cái thứ ba lại cho tới khi cả hai đã ra sản phẩm.
Cho agent QA chạy song song với hai agent dựng thì nó đi review một app chưa tồn tại. Cho nó chạy muộn quá thì bạn đã ghép xong hai nửa vốn chưa bao giờ thống nhất với nhau về hợp đồng API. Cái cổng đó phải nằm đúng chỗ video đặt nó.
Có hai chi tiết trong prompt làm được nhiều việc hơn độ dài của chúng.
Mỗi agent được giao một đường dẫn riêng. /server cho backend, /client cho frontend, /game/core.js và /game/ui.js cho hai nửa của game. Các agent chạy song song mà dùng chung thư mục và không có lãnh thổ thì sẽ ghi đè lên nhau; chỉ định thư mục cho từng agent chính là toàn bộ cơ chế chống giẫm chân, và nó tốn đúng một dòng.
Agent QA được bảo phải thử cái gì, chứ không phải "test đi". Gửi mảng rỗng, gửi chuỗi dài hơn 100 ký tự, kiểm tra checklist còn nguyên khi chuyển qua lại giữa các món. Sinh 150 quái cùng lúc rồi nhìn khung hình, cho nhân vật đi ra ngoài mép bản đồ, nhận sát thương liên tục xem có bị bất tử không, mở bảng nâng cấp xem game có pause thật không.
Danh sách đó là một tập dự đoán về cách sản phẩm sẽ hỏng. Một agent được bảo "verify app" sẽ báo là app chạy được, vì nó không biết sai trông ra sao. Bạn phải gọi tên cái lỗi mình sợ trước, thì mới có thứ gì đi tìm nó.
Lần một — app gợi ý món ăn
SmartChef: chọn thứ đang có trong tủ lạnh, nhận về ba món.
Cả hai prompt để nguyên ngôn ngữ gốc — prompt là một artifact, dịch nó là đổi mất thứ đã chạy.
Prompt — Smart Chef: ba sub-agent song song
ACT AS A LEAD SOFTWARE ARCHITECT & MULTI-AGENT ORCHESTRATOR.
PROJECT: "Smart Chef - AI Recipe & Meal Planner Web App"
MODEL ENGINE: Gemini 3.7 Flash
INSTRUCTIONS:
Phân tích yêu cầu dự án và TỰ ĐỘNG KHỞI TẠO (SPAWN) 3 SUB-AGENTS ĐỘC LẬP chạy song song để hoàn thành sản phẩm full-stack:
---
### SUB-AGENT 1: [BACKEND SPECIALIST]
- **Target Folder:** `/server` hoặc `/api`
- **Task:**
1. Viết REST API bằng Express/FastAPI có endpoint `POST /api/recipes` nhận danh sách nguyên liệu `{ ingredients: string[] }`.
2. Tạo logic trả về danh sách 3 món ăn chuẩn JSON schema (gồm: id, title, cooking_time, calories, difficulty, matched_ingredients, missing_ingredients, steps[]).
3. Xử lý an toàn: Validate dữ liệu rỗng và xử lý các nguyên liệu xung đột kỳ lạ.
---
### SUB-AGENT 2: [FRONTEND & UI SPECIALIST]
- **Target Folder:** `/client` hoặc `/src`
- **Task:**
1. Xây dựng giao diện React + TailwindCSS trực quan:
- Khung chọn tag nguyên liệu nhanh (Thịt bò, Trứng, Rau...) + Ô text input nhập tự do.
- 3 thẻ Card hiển thị món ăn kèm badge thời gian, calo và danh sách nguyên liệu thiếu màu cam.
- Danh sách các bước nấu dạng Interactive Checklist (tick hoàn thành có hiệu ứng gạch ngang chữ).
2. Đảm bảo trạng thái tick checklist không bị mất khi chuyển qua lại giữa các món ăn.
---
### SUB-AGENT 3: [QA & TEST AUTOMATION SPECIALIST]
- **Target Task:**
1. Đợi Sub-Agent 1 & 2 sinh code xong, tự động chạy test suite hoặc curl test.
2. Kiểm tra 3 trường hợp: Gửi mảng rỗng `[]`, nhập chuỗi dài >100 ký tự, và kiểm tra tính bền vững trạng thái (state persistence) của checklist.
3. Nếu phát hiện lỗi (FAIL), tự động tạo bug ticket và kích hoạt Sub-Agent tương ứng để sửa lại mã nguồn cho đến khi PASS 100%.
---
EXECUTION RULE:
- Tự động chia task và kích hoạt đồng thời Sub-Agent 1 & 2.
- Sub-Agent 3 sẽ tự động vào can thiệp ngay khi quá trình sinh mã nguồn hoàn tất để thực hiện vòng lặp Self-Healing.
- Bắt đầu thực thi ngay lập tức!| Frontend + backend, chạy song song | ~4 phút |
| Lượt QA | ~5 phút |
| Tổng kể cả lúc chạy | ~6 phút |
| Quota tiêu thụ | chưa tới 1% của hạn mức 5 giờ |
Kết quả: chọn thịt bò, đậu phụ và nấm thì nó trả về ba món — canh đậu phụ rong biển nấm, bò lúc lắc khoai tây, đậu phụ sốt cà chua — mỗi món tách rõ nguyên liệu đã có và nguyên liệu cần mua thêm, kèm các bước đánh số tích được, và hiển thị thời gian, calo, độ khó trên thẻ. Đổi đầu vào sang thịt gà, thịt heo, khoai tây, cà rốt, trứng thì gợi ý đổi theo.
Tác giả chấm 8/10, và lý do đưa ra còn đáng giá hơn con số: các món gợi ý là món người ta thật sự nấu. Một cái máy gợi ý công thức trả về đồ ăn đúng về mặt kỹ thuật nhưng chẳng ai làm là kiểu hỏng khó phát hiện hơn nhiều so với một cú crash.
Lần hai — game sinh tồn 2D
Cyber Survivor: HTML5 canvas, JavaScript thuần, không framework.
Prompt — Cyber Survivor 2D: ba sub-agent song song
ACT AS A LEAD GAME ARCHITECT & MULTI-AGENT ORCHESTRATOR.
PROJECT: "Cyber Survivor 2D - Browser Action Game"
TECH STACK: HTML5 Canvas + Vanilla JavaScript (hoặc Phaser 3) + TailwindCSS (Single-page web game, chạy ngay trên trình duyệt không cần setup phức tạp).
MODEL ENGINE: Gemini 3.7 Flash
INSTRUCTIONS:
Tự động khởi tạo (spawn) 3 Sub-Agents độc lập chạy song song để thiết kế và hoàn thiện toàn bộ trò chơi:
---
### SUB-AGENT 1: [GAME ENGINE & LOGIC SPECIALIST]
- **Target File:** `/game/core.js` hoặc file logic chính.
- **Nhiệm vụ:**
1. Xây dựng Game Loop (60 FPS) với các cơ chế chính:
- Player Movement: Di chuyển nhân vật mượt mà bằng phím WASD / Phím mũi tên.
- Auto-Shooting: Tự động bắn đạn về phía quái vật gần nhất theo chu kỳ.
- Enemy Spawner: Sinh quái vật theo từng đợt (Wave), quái tự động tìm đường đuổi theo Player.
- Collision Detection: Xử lý va chạm giữa đạn - quái và quái - player (mất máu, tính điểm XP, rơi vật phẩm tăng cấp).
2. Cân bằng chỉ số (Game Balancing): Tăng dần tốc độ và số lượng quái theo thời gian sống sót.
---
### SUB-AGENT 2: [UI/UX, SPRITES & SOUND SPECIALIST]
- **Target File:** `/game/ui.js` & `index.html`
- **Nhiệm vụ:**
1. Thiết kế giao diện phong cách Cyberpunk Retro:
- Màn hình Game HUD: Thanh máu (HP Bar), Thanh kinh nghiệm (XP Bar), Điểm số (Score), Đồng hồ sống sót (Survival Timer).
- Hiệu ứng hình ảnh Canvas (VFX): Hiệu ứng nổ hạt (Particle effects) khi quái bị tiêu diệt, màn hình nhấp nháy đỏ khi nhận sát thương.
- Tạo pop-up "Level Up - Chọn 1 trong 3 nâng cấp" (Tăng tốc bắn, Tăng máu, Đạn chùm).
2. Tích hợp âm thanh Web Audio API đơn giản (tiếng bắn, tiếng nổ, tiếng nhặt đồ bằng code âm tần tổng hợp, không cần tải file ngoài).
---
### SUB-AGENT 3: [GAMEPLAY TESTER & BALANCE QA]
- **Target File:** `/game/tester.js` hoặc kịch bản kiểm thử tự động.
- **Nhiệm vụ:**
1. Chạy giả lập Auto-Play (Bot tự chơi) để stress-test:
- Test Lag / Drop FPS: Sinh đồng thời 150 quái vật trên màn hình để kiểm tra hiện tượng tụt khung hình.
- Test Edge Cases: Nhân vật đi ra ngoài mép bản đồ (Out of bounds), quái bị kẹt góc không di chuyển, hoặc lỗi bất tử khi nhận sát thương liên tục.
- Test Level-up Freeze: Kiểm tra game có pause chính xác khi mở bảng chọn nâng cấp không.
2. Báo cáo lỗi và yêu cầu Sub-Agent 1 & 2 vá code ngay lập tức nếu game bị giật hoặc phát hiện bug logic.
---
EXECUTION RULE:
- Sub-Agent 1 & 2 làm việc song song để đồng bộ giữa Canvas Rendering và Game Logic.
- Sub-Agent 3 chạy ngay sau khi dựng xong game base để cân bằng chỉ số và fix bug.
- Đầu ra là một file `index.html` (hoặc project bundle) mở lên là chơi được ngay lập tức!Lần này nó ra bản kế hoạch kiến trúc trước — tầng giao diện, tầng logic, vòng lặp game — rồi mới viết gì đó. Bản kế hoạch đủ chi tiết để review được, và đó chính là khác biệt giữa một agent bạn giám sát được với một agent bạn chỉ ngồi nhìn.
Rồi nó dựng game, và game chạy ngay lần đầu: bắn sinh tồn nhìn từ trên xuống, có HP, đồng hồ trụ được bao lâu, level, điểm số, và vật phẩm nâng cấp đưa bạn từ một tia đạn lên hai rồi ba. Không crash trong lúc chơi.
Cả hai lần dựng cộng lại hết khoảng 8% hạn mức 5 giờ.
Những chỗ bản demo không tô hồng
Phải duyệt tay nếu không tắt đi. Lượt chạy không để chế độ auto, nên agent dừng lại chờ duyệt npm install — hai lần. Đó là mặc định đúng, và nó cũng có nghĩa "sáu phút" là sáu phút có người ngồi đó.
Không sửa được sub-agent giữa chừng. Đã kích hoạt rồi thì không có kênh nào gửi tin nhắn cho chúng; bạn xem được chúng đang làm gì, hết. Nếu một sub-agent đi sai hướng, can thiệp duy nhất là để nó chạy xong rồi prompt lại.
Cả hai bài đều không khó. Một app gợi ý món ăn và một game bắn trên canvas là những hình dạng đã mòn lối, có lượng tài liệu tham chiếu khổng lồ. Chúng chứng minh vòng lặp agent không vỡ; chúng không chạm tới trần. Một model hạng 23 về code và một model hạng nhất đều được kỳ vọng vượt qua cái ngưỡng này — và chính vì thế kết quả mới đáng chú ý chứ không phải đáng chê.
Hạng 23 thật sự có nghĩa gì
Đây là chỗ hai bảng điểm hoà giải với nhau, và là thứ mình mang về.
Bảng xếp hạng so các model với nhau ở việc khó nhất có thể giao. Đó là phép đo có giá trị, và nó không phải phép đo mà phần lớn công việc cần. Phần lớn công việc có một ngưỡng: hoặc model vượt qua đầu việc, hoặc không. Ở trên vạch đó, thứ hạng thôi thay đổi kết quả, chỉ còn giá và độ trễ là tiếp tục nhúc nhích.
Hai lần dựng, chạy ngay lần đầu, không crash, chưa tới 10% quota là bằng chứng rằng với lớp bài toán này, hạng 23 nằm thoải mái trên vạch. Nó không phải bằng chứng rằng model này thật ra là số một — bảng xếp hạng đang đo một thứ có thật, và với một bài toán khó thật sự thì hai mươi hai bậc kia sẽ hiện ra dưới dạng lượt chạy hỏng và giờ công đốt đi.
Nên cách diễn đạt trung thực thì hẹp mà dùng được: chọn theo ngưỡng, đừng chọn theo thứ hạng. Xác định xem model rẻ có vượt được vạch của riêng bạn không; nếu có, thì hai mươi hai model phía trên đang bán cho bạn phần dư mà bạn không dùng tới.
Hệ quả là nửa khó chịu còn lại: bạn chỉ biết vạch của mình nằm ở đâu bằng cách cho model rẻ chạy một việc thật rồi nhìn nó hỏng. Đó cũng là một khoản chi phí, và là khoản không ai vẽ lên biểu đồ.
Điều mình rút ra
Kích hoạt hai, chốt cổng ở cái thứ ba. Hai agent dựng song song cộng một agent QA chỉ chạy sau khi cả hai đã ra sản phẩm — chính cấu trúc đó làm nên việc, không phải model.
Đòi kế hoạch trước khi đòi code. Lần dựng game ra bản kiến trúc review được trước, và đó là điểm duy nhất mà sửa còn rẻ — nhất là khi sub-agent đã chạy thì không sửa được nữa.
Benchmark của hãng và bảng độc lập trả lời hai câu hỏi khác nhau. Một bên nói nó giỏi tới đâu, bên kia nói nó đứng ở đâu giữa các đối thủ. Không bên nào nói nó có vượt vạch của bạn hay không.
Rẻ làm đổi thứ bạn sẵn sàng thử. Ở mức chưa tới 1% quota cho mỗi app, phép tính thôi còn là "đây có phải model tốt nhất không" mà thành "có lý do gì để không thử không" — và cú dịch chuyển đó quan trọng hơn tám bậc trên bảng xếp hạng.
Liên quan
- Google Antigravity 2.0: màn hình cài đặt mới là phần đáng đọc — nền tảng mà hai lần dựng này chạy trên đó, và agent chạy theo lịch được đụng vào những gì.
- Codex: thư mục local mới là sản phẩm — một nền tảng agent khác, và mô hình phân quyền bên dưới nó.
- Buổi 4 — Quản trị AI Engineering — vì sao một dấu tích xanh chỉ đáng giá bằng bằng chứng đứng sau nó.