So sánh model AI cho lập trình 2026: Claude Opus 5.5, GPT-6, Gemini 3.8, Grok 4.7
Model AI nào code tốt nhất lúc này? Bài này đặt Claude Opus 5.5, Sonnet 5.5, GPT-6.1 Sol, Gemini 3.8 Flash, Grok 4.7 và các model open-weight lên cùng một bảng: định vị, context, giá API, dùng được ở công cụ nào. Kèm cách đọc benchmark và gợi ý chọn model theo loại việc.
Chỉ trong khoảng năm tuần từ đầu tháng 9/2026: Google ra Gemini 3.8 Flash (2/9), OpenAI ra GPT-6 Astra (3/9), GPT-6 Sol và Luna (22/9) rồi GPT-6.1 Sol (29/9), xAI ra Grok 4.7 (21/9), Anthropic ra Claude Opus 5.5 (22/9), Sonnet 5.5 (28/9) và Haiku 5.5 (7/10). Model picker trong Copilot hay Cursor giờ có vài chục lựa chọn, và câu hỏi "model AI nào code tốt nhất" không có một đáp án chung.
Bài này không chấm ai là số 1, mà giúp bạn đọc đúng số liệu các hãng công bố và chọn model hợp với loại việc và công cụ đang dùng. Nếu chưa chọn công cụ, đọc trước bài Cursor vs Copilot vs Claude Code.
Các lựa chọn chính lúc này
Anthropic: Opus 5.5, Fable 5.1, Sonnet 5.5, Haiku 5.5
Claude Opus 5.5 (22/9) là model đầu tiên của dòng Claude 5.5. Anthropic nói nó đạt mức của Fable 5.1 trên phần lớn công việc, trong khi chi phí chạy thấp hơn khoảng 40% so với Opus 5. Docs khuyên nếu phân vân thì bắt đầu với Opus 5.5, và đây cũng là model mặc định trong Claude Code cho các gói Pro, Max, Team, Enterprise và API.
Claude Fable 5.1 là model chậm và đắt nhất của Anthropic, được định vị cho reasoning khó và task agent dài hơi. Docs gợi ý dùng Fable cho loại việc đó, hoặc khi Opus 5.5 ở effort cao vẫn chưa đạt. Lưu ý: trên chính các benchmark Anthropic công bố, Opus 5.5 đang nhỉnh hơn Fable 5.1.
Claude Sonnet 5.5 (28/9) giữ nguyên giá của Sonnet 5 ($2 / $10), nhưng Anthropic nói nó sinh output nhanh hơn trên 30% và rẻ hơn tới khoảng 30% mỗi task nhờ dùng ít token hơn. Anthropic định vị Sonnet 5.5 là bản nhanh và rẻ hơn đi kèm Opus 5.5, hợp với việc hằng ngày được khoanh rõ phạm vi như fix bug. Claude Haiku 5.5 (7/10) là model nhỏ, nhanh và rẻ nhất, dành cho classification, extraction, routing, subagent. Giá Haiku 5.5 tính theo độ dài prompt: $0,10 / $0,50 khi prompt tới 100K token, $0,50 / $2,50 khi vượt 100K. Haiku 5.5 dùng tokenizer mới nên tốn nhiều token hơn một chút cho cùng nội dung.
Sonnet 5 và Haiku 4.5 giờ nằm ở mục legacy (vẫn dùng được). Trong Claude Code, alias sonnet và haiku trên Anthropic API đã trỏ sang Sonnet 5.5 và Haiku 5.5.
OpenAI: GPT-6 Astra, GPT-6.1 Sol, GPT-6 Luna
- GPT-6 Astra: model mạnh nhất của OpenAI, cho những việc end-to-end khó nhất. Giá ngang Fable.
- GPT-6.1 Sol (29/9): bản kế nhiệm GPT-6 Sol, ra đúng một tuần sau. OpenAI mô tả nó đạt hiệu năng gần Astra cho coding phức tạp, computer use và công việc chuyên môn, với chi phí thấp hơn. Giá vẫn $2 / $10, ngang Sonnet 5.5.
- GPT-6 Luna: model hiệu quả nhất, cho task tập trung với khối lượng lớn.
Cả ba là model được khuyến nghị trong Codex, và GPT-6.1 Sol hiện là mặc định của Codex CLI. Muốn cố định, đặt model = "gpt-6.1-sol" trong config.toml.
Google: Gemini 3.8 Flash và Gemini 3.1 Pro
Gemini 3.8 Flash (2/9) được Google mô tả là thiết kế cho software engineering dài hơi và autonomous agent. Context 1M, output tối đa 64K. Giá hiện tại là giá giới thiệu tới hết 31/12/2026, từ 1/1/2027 tăng gấp đôi. Pro mới nhất vẫn là Gemini 3.1 Pro (Preview), chưa có 3.8 Pro.
xAI: Grok 4.7
Grok 4.7 (21/9) được xAI (nay mang tên SpaceXAI) giới thiệu là model mạnh nhất của họ cho coding và knowledge work. Context 500K, giá output thấp so với các model cùng tầm.
Open-weight: DeepSeek V4.1 Flash, Kimi K3
- DeepSeek-V4.1-Flash (10/9): MoE 552B tham số (kích hoạt 8B khi prefill, 16B khi decode), license MIT, weights trên Hugging Face. API rẻ, rẻ hơn nữa vào giờ thấp điểm.
- Kimi K3 (Moonshot AI): 2,8T tham số tổng, 104B active, weights phát hành tháng 7/2026 theo license riêng "Kimi K3 License".
Bảng so sánh nhanh
Giá API chuẩn theo trang chính thức, USD trên 1 triệu token (input / output), chưa gồm cache hay batch.
| Model | Định vị | Context | Giá API in / out | Dùng ở đâu |
|---|---|---|---|---|
| Claude Opus 5.5 | Agentic coding chạy dài | 1M | $4 / $20 | Claude Code (mặc định), Copilot (từ Pro+), Cursor |
| Claude Fable 5.1 | Reasoning khó, task rất dài | 1M | $10 / $50 | Claude Code (/model fable), Copilot (từ Pro+), Cursor |
| Claude Sonnet 5.5 | Cân bằng tốc độ và năng lực | 1M | $2 / $10 | Claude Code, Copilot (từ Pro), Cursor |
| Claude Haiku 5.5 | Nhanh nhất, khối lượng lớn | 1M | $0,10 / $0,50 (prompt tới 100K), $0,50 / $2,50 (trên 100K) | Claude Code, Cursor |
| GPT-6 Astra | Mạnh nhất của OpenAI | 1,05M | $10 / $50 | Codex, Copilot (từ Pro+) |
| GPT-6.1 Sol | Gần Astra, chi phí thấp hơn | 1,05M | $2 / $10 | Codex (mặc định CLI), Copilot (từ Pro+) |
| GPT-6 Luna | Hiệu quả, khối lượng lớn | 1,05M | $0,10 / $0,50 | Codex, Copilot (từ Pro) |
| Gemini 3.8 Flash | SWE dài hơi, agent | 1M | $0,75 / $3,75 (tới 31/12/2026), sau đó $1,50 / $7,50 | Gemini API, Antigravity, Copilot, Cursor |
| Gemini 3.1 Pro (Preview) | Pro mới nhất của Google | 1M | $2 / $12 (prompt tới 200K) | Gemini API, Cursor |
| Grok 4.7 | Coding, agentic | 500K | $2 / $6 | Cursor, Copilot, Grok Build, API |
| DeepSeek-V4.1-Flash | Open-weight, license MIT | 1M | $0,15-0,30 / $0,60-1,20 (thấp điểm / cao điểm) | DeepSeek API, tự host |
| Kimi K3 | Agentic, open-weight | 1M | $3 / $15 (giá trong Copilot) | Copilot, Cursor, Kimi API, tự host |
Vài điểm đáng chú ý:
- Sonnet 5.5 và GPT-6.1 Sol cùng giá $2 / $10, hai hãng cạnh tranh trực diện ở mức này (Grok 4.7 cùng giá input, output rẻ hơn).
- Tầng giá rẻ vừa bị kéo xuống: Haiku 5.5 (prompt tới 100K) và GPT-6 Luna cùng $0,10 / $0,50, rẻ hơn Haiku 4.5 khoảng 10 lần. Gemini 3.8 Flash ($0,75 / $3,75, tăng gấp đôi từ 1/1/2027) giờ đắt hơn hai model này nhiều lần.
- Trong Copilot, gói Pro ($10/tháng) có Sonnet 5.5 nhưng không có Opus, Fable, GPT-6 Astra và GPT-6.1 Sol, cần Pro+ trở lên (hoặc Business, Enterprise). Lúc viết, Haiku 5.5 chưa có trong danh sách model của Copilot.
- Đầu tháng 10/2026, trang models của Cursor đã có Sonnet 5.5 và Haiku 5.5 nhưng vẫn chưa có GPT-6.
Benchmark: các hãng báo cáo gì, và vì sao đừng so số chéo
Một số con số lấy trực tiếp từ trang chính thức của từng hãng:
| Model | Terminal-Bench 4.0 | Terminal-Bench 2.1 | DeepSWE v1.1 | Nguồn |
|---|---|---|---|---|
| Claude Opus 5.5 | 66,4% | không báo cáo | không báo cáo | Anthropic |
| Claude Sonnet 5.5 | 70,6% | không báo cáo | không báo cáo | Anthropic |
| Claude Haiku 5.5 | 39,2% | không báo cáo | không báo cáo | Anthropic |
| GPT-6 Astra | 57,9% (Anthropic đo) | không báo cáo | không báo cáo | Anthropic |
| Grok 4.7 | 37,6% | không báo cáo | 71,0% (effort high) | xAI |
| Gemini 3.8 Flash | 19,1% | 89,4% | 73,7% | Google (model card) |
| DeepSeek-V4.1-Flash | không báo cáo | 90,6% | 74,2% | DeepSeek (Hugging Face) |
| Kimi K3 | không báo cáo | 88,3% | không rõ phiên bản | Moonshot (Hugging Face) |
Cùng tên benchmark, khác phiên bản, khác hẳn độ khó. Gemini 3.8 Flash đạt 89,4% trên Terminal-Bench 2.1 nhưng chỉ 19,1% trên Terminal-Bench 4.0: cùng một model, chênh hơn 70 điểm. Đem 90,6% (bản 2.1) của DeepSeek so với 66,4% (bản 4.0) của Opus 5.5 rồi kết luận DeepSeek code giỏi hơn là không có cơ sở.
Cùng bộ, cùng phiên bản, nhưng khác người chạy thì số cũng khác. Trên Terminal-Bench 4.0, Anthropic báo Fable 5.1 đạt 55,8%, còn trang Grok 4.7 của xAI lại ghi Fable 5.1 đạt 57,9%. Ngay trong bảng trên, điểm Terminal-Bench 4.0 của Opus 5.5, Grok 4.7 và Gemini 3.8 Flash cũng do ba hãng tự chạy với harness riêng, nên chỉ nên xem là tham khảo.
Mỗi hãng chọn bộ benchmark riêng. Anthropic báo cáo Terminal-Bench 4.0, CursorBench 4.0, OSWorld 2.0; OpenAI báo cáo cho GPT-6 Sol các bộ như DeepSWE v1.1, OSWorld 2.0 Offline, AutomationBench; Google đưa DeepSWE v1.1 và cả hai phiên bản Terminal-Bench. Phần giao nhau khá ít, và kể cả khi trùng bộ thì cấu hình chạy vẫn khác nhau.
Benchmark khác nhau đo thứ khác nhau. Ngay trên trang của Anthropic, nơi một hãng chạy cả hai model, Opus 5.5 dẫn GPT-6 Astra ở Terminal-Bench 4.0 (66,4% so với 57,9%) nhưng thua ở AutomationBench (40,0% so với 41,4%) và Terminal-Bench-Science 0.1 (58,7% so với 64,6%). Ngay trong cùng một hãng: Sonnet 5.5 đạt 70,6% Terminal-Bench 4.0, cao hơn 66,4% của Opus 5.5, nhưng Anthropic vẫn định vị Opus 5.5 cho việc phức tạp. Không có con số nào đại diện cho "code giỏi" nói chung.
Cách dùng benchmark hợp lý: xem nó như tín hiệu sơ bộ để khoanh vùng vài ứng viên, rồi tự thử.
Chọn model theo loại việc
Code hằng ngày, kể cả khi ngân sách hạn chế
Sửa bug nhỏ, viết component, viết test cho một file: ở đây phản hồi nhanh quan trọng hơn năng lực cao nhất.
Gợi ý: Claude Sonnet 5.5, GPT-6.1 Sol, Gemini 3.8 Flash, hoặc để Auto nếu dùng Copilot, Cursor. Opus 5.5 vẫn dùng tốt cho việc hằng ngày trong Claude Code, nhưng với việc đơn giản bạn đang trả nhiều hơn mức cần.
Nếu ngân sách eo hẹp: Copilot Free / Student chỉ dùng Auto (không tự chọn model), đủ để làm quen. Copilot Pro ($10/tháng) có Sonnet 5.5, Gemini 3.8 Flash, GPT-6 Luna, Grok 4.7. Gemini API có free tier cho Gemini 3.8 Flash, hợp để thử khi tự build tool.
Refactor lớn, task agent chạy dài
Migrate sang TypeScript, đổi thư viện state management, tính năng chạm vào hàng chục file: cần model giữ mạch qua nhiều bước và tự kiểm tra kết quả.
Gợi ý: Claude Opus 5.5 trong Claude Code, hoặc GPT-6.1 Sol / Astra trong Codex. Nếu Opus 5.5 vấp ở task đặc biệt khó, thử tăng effort trước (/effort high, mặc định của Opus 5.5 là medium), rồi mới cân nhắc Fable 5.1. Task dài vẫn cần quản context tốt, xem bài Context engineering là gì và Claude Code nâng cao.
Việc khối lượng lớn, cần rẻ
Sinh commit message trong CI, phân loại issue, tóm tắt log: chi phí mỗi request quan trọng hơn chất lượng đỉnh.
Gợi ý: Claude Haiku 5.5, GPT-6 Luna, DeepSeek-V4.1-Flash, hoặc Gemini 3.8 Flash. Với Haiku 5.5, giữ prompt dưới 100K token để hưởng mức giá thấp, và đo lại số token thực tế vì tokenizer mới. Nếu hệ thống cũ đang gọi Haiku 4.5 (giờ là legacy), đây là lúc lên kế hoạch đổi model ID.
Bảo mật dữ liệu, tự host
Không được gửi code ra API ngoài thì lựa chọn là open-weight trên hạ tầng riêng: DeepSeek-V4.1-Flash (MIT, chạy bằng vLLM, SGLang) hoặc Kimi K3 (license riêng, đọc kỹ trước khi dùng thương mại). Đây là model hàng trăm tỉ tham số trở lên, cần cụm GPU nghiêm túc. Hướng trung gian: dùng Claude qua Amazon Bedrock hoặc Google Cloud.
Lời khuyên thực tế: chọn công cụ trước, rồi mới chọn model
Công cụ quyết định nhiều hơn bạn nghĩ
Cùng một model, chạy trong harness khác nhau (cách đưa context, tool, chạy lệnh) cho kết quả khác nhau. Claude Code được tối ưu cho Claude, Codex cho GPT-6, Copilot và Cursor đa model. Thứ tự hợp lý:
- Chọn công cụ hợp cách bạn làm việc: terminal (Claude Code, Codex CLI) hay IDE (Copilot, Cursor).
- Dùng model mặc định hoặc Auto của công cụ đó vài tuần.
- Chỉ đổi model khi gặp loại việc mà mặc định làm chưa tốt.
Dùng Auto khi chưa có lý do cụ thể
Copilot Auto có ba mức: Efficiency (ưu tiên chi phí), Balance và Intelligence (ưu tiên chất lượng), trong VS Code, Copilot CLI và Copilot app; gói trả phí được giảm 10% chi phí model khi dùng Auto. Cursor Auto cũng có ba mức: Cost, Balance, Intelligence.
Từ tháng 6/2026, Copilot tính phí theo AI Credits với giá mỗi model bám sát giá API (Opus 5.5 vẫn là $4 / $20 cho mỗi 1M token). Chọn model đắt cho việc đơn giản sẽ làm hết credit nhanh hơn. Chi tiết ở bài GitHub Copilot là gì.
Thử trên codebase của chính bạn
Benchmark chạy trên repo của người khác, còn bạn cần biết model nào làm tốt trên repo của bạn. Một buổi chiều là đủ:
- Chọn 5 đến 10 task thật đã xong trong git history: vài bug fix, một tính năng nhỏ, một refactor. Bạn đã biết đáp án đúng trông ra sao.
- Với mỗi model, tạo một worktree riêng từ commit ngay trước task đó.
- Đưa cùng một prompt, chạy non-interactive, rồi so kết quả.
git worktree add ../try-claude abc1234
git worktree add ../try-codex abc1234
# Claude Code, chế độ print
cd ../try-claude
claude -p "Fix bug: giỏ hàng không cập nhật tổng tiền khi xóa sản phẩm. Chạy test sau khi sửa." --model sonnet --allowedTools "Read,Edit,Bash"
# Codex CLI, chế độ exec
cd ../try-codex
codex exec -m gpt-6.1-sol --sandbox workspace-write "Fix bug: giỏ hàng không cập nhật tổng tiền khi xóa sản phẩm. Chạy test sau khi sửa."Mặc định claude -p và codex exec không được sửa file, nên phải cấp quyền như trên. Chỉ chạy trong worktree thử nghiệm.
| Tiêu chí | Cách đo |
|---|---|
| Đúng không | Test pass? So với fix thật trong git history |
| Diff có sạch không | Có sửa file không liên quan, thêm code thừa không |
| Phải nhắc lại bao nhiêu | Số lượt nhắc thêm để ra kết quả chấp nhận được |
| Chi phí và thời gian | Token hoặc credit đã dùng, thời gian chạy |
Mười task không phải nghiên cứu khoa học, nhưng sát công việc thật hơn mọi bảng xếp hạng.
Tóm lại: model AI nào code tốt nhất?
- Không có model tốt nhất cho mọi việc. Đầu tháng 10/2026, Opus 5.5 và GPT-6.1 Sol / Astra mạnh cho task agent dài, Sonnet 5.5 / GPT-6.1 Sol / Gemini 3.8 Flash hợp việc hằng ngày, Haiku 5.5 / GPT-6 Luna / DeepSeek cho khối lượng lớn, DeepSeek / Kimi K3 cho nhu cầu tự host.
- Đọc benchmark phải xem phiên bản và ai chạy.
- Chọn công cụ trước, dùng mặc định hoặc Auto, tự thử trên codebase của bạn trước khi đổi.
Model nào cũng chỉ tốt bằng khả năng review của người dùng nó. Nếu làm frontend, khóa React PRO của HoleTex giúp bạn nắm React đủ sâu để làm chủ code do AI sinh ra. Còn muốn rèn tư duy giải quyết vấn đề, phần bạn vẫn phải tự làm, thử luyện thuật toán trên HoleTex Algo.
Bài liên quan
- Cursor vs Copilot vs Claude Code: nên chọn công cụ nào
- GitHub Copilot là gì
- Claude Code nâng cao: subagents, hooks, skills
- Context engineering là gì
- Lập trình với AI 2026: bản đồ toàn cảnh
Nguồn tham khảo: Claude Opus 5.5 (anthropic.com), Claude Sonnet 5.5 (anthropic.com), Claude Haiku 5.5 (anthropic.com), Models overview (platform.claude.com), OpenAI models (developers.openai.com), GPT-6.1 Sol (developers.openai.com), Codex models (learn.chatgpt.com), Codex non-interactive (learn.chatgpt.com), Gemini 3.8 Flash model card (deepmind.google), Gemini API pricing (ai.google.dev), Grok 4.7 (x.ai), DeepSeek-V4.1-Flash (huggingface.co), Kimi K3 (huggingface.co), Copilot plans (docs.github.com), GPT-6.1 Sol trong Copilot (github.blog), Cursor models (cursor.com), Copilot auto model selection (docs.github.com), Claude Code headless (code.claude.com). Cập nhật 2026-10-08.