AI Model Stack — Multi-Provider Reference
Cheatsheet thực dụng cho việc chọn & định tuyến model AI theo capability → workload → cost → provider → fallback.
✦ View the full interactive versionCheatsheet thực dụng cho việc chọn & định tuyến model AI theo capability → workload → cost → provider → fallback.
◆ INSIGHT CHÍNH Đừng chọn “một model tốt nhất”. Một model mạnh nhất cho reasoning chưa chắc tốt nhất cho TTS/video/OCR. Hãy xây AI Model Router: chọn model theo từng loại task, không theo tên hãng.
Vòng lặp quyết định
Request vào → Gateway → Model Router
├── chat / dịch → Tier rẻ (Luna · Flash · DeepSeek)
├── code / agent → Tier chuyên nghiệp (Claude Sonnet · GPT Sol)
├── reasoning khó → Tier frontier (GPT Astra · Claude Opus)
└── riêng tư / offline → Local (Ollama · Qwen · Llama)
→ Response
Application không gọi thẳng 1 provider — mọi request đi qua Gateway rồi Router quyết định model.
4 tầng của Stack
| Tầng | Models | Chi phí |
|---|---|---|
| ① FRONTIER | GPT-6 Astra · Claude Opus 5 · Gemini 3.1 Pro flagship — bài toán khó nhất, ~5–10% workload | $$$$ |
| ② PROFESSIONAL | GPT-5.6 Sol/Terra · Claude Sonnet 5 · Gemini Pro — coding, agent, công việc quan trọng | $$–$$$ |
| ③ CHEAP CLOUD | GPT-5.6 Luna · Gemini Flash/Lite · DeepSeek · Kimi — ~80% workload thường ngày | $ |
| ④ LOCAL | Ollama · Qwen · Llama · Gemma — riêng tư, offline, thử nghiệm | ≈ điện |
Dùng sheet này thế nào
- 01 Phân loại — 17 loại nhiệm vụ AI (chat, reasoning, OCR, TTS, video…)
- 02 Task→Model — bảng tra nhanh: task nào dùng model family nào, giá bao nhiêu
- 03 Providers — chi tiết từng hãng: OpenAI, Google, Anthropic, xAI, DeepSeek, Kimi
- 04 Token & Chi phí — token, thinking token, credit, công thức tính giá
- 05 Kiến trúc — sơ đồ Gateway/Router + config YAML mẫu
- 06 Chiến lược Tier — quy tắc 80/15/5, khi nào dùng model cũ
- 07 Vận hành — field cần log, 6 loại chi phí của agent
- 08 Ma trận — bảng quyết định cuối cùng, tra 1 phát ra model
Phân loại Model theo Capability
Đừng nhìn model theo tên hãng — chia theo năng lực thực hiện.
17 loại nhiệm vụ
| Loại | Nhiệm vụ chính | Ví dụ model |
|---|---|---|
| General Chat / Fast | Chat, Q&A, rewrite, dịch | GPT-5.6 Luna, Gemini Flash, Claude Sonnet |
| Reasoning | Phân tích nhiều bước | GPT-5.6 Sol, Gemini Pro, Claude |
| Deep Thinking / Frontier | Bài toán khó, architecture, research | GPT-6 Astra, Claude Opus 5, Gemini Pro |
| Long Context | Đọc codebase/docs lớn | Gemini, Claude, GPT |
| Coding | Sinh code / debug / refactor | Claude Sonnet, GPT, Gemini |
| Agentic Coding | Code + terminal + browser + tools | Claude Sonnet 5, GPT, Gemini 3.8 Flash |
| Vision / OCR | Ảnh/PDF/screenshot → text | Gemini, GPT, Claude |
| Image Generation | Ảnh/diagram/art/UI | Gemini image, GPT image, Grok Imagine |
| Diagram Generation | Architecture/flowchart/UML | LLM → Mermaid/SVG hoặc image model |
| Speech-to-Text | Audio → text | Gemini Transcribe, Grok Voice Transcribe |
| Text-to-Speech | Text → voice | Gemini/Grok/OpenAI/ElevenLabs |
| Realtime Voice | Nói chuyện trực tiếp | Gemini Live, realtime models |
| Video Generation | Text/ảnh → video | Gemini video, Grok Imagine, Veo-family |
| Embedding | Semantic search / RAG | embedding models |
| Reranker | Xếp hạng lại kết quả search | specialized rerankers |
| Moderation / Safety | Phát hiện nội dung độc hại | provider moderation models |
| Small / Local | Riêng tư / offline / rẻ | Llama, Qwen, Gemma, DeepSeek/Kimi open |
▲ CHAT ≠ REASONING ≠ THINKING “What is REST API?” → dùng tier rẻ (Flash/Luna). “Thiết kế architecture cho 10 triệu user” → cần reasoning model. “Phân tích ràng buộc, so sánh 4 kiến trúc, ước lượng failure mode, viết ADR” → cần deep reasoning / frontier.
Bản đồ Task → Model Family
Tra nhanh: đang làm task gì thì nên gọi nhóm model nào, tốn khoảng bao nhiêu.
| Task | Model family nên xem xét | Cost | Đặc tính |
|---|---|---|---|
| Chat bình thường | Luna / Flash / Sonnet | $ | nhanh |
| Chat chất lượng cao | Claude Sonnet / GPT Terra | $$ | cân bằng |
| Deep reasoning | GPT Sol / Gemini Pro / Claude Opus | $$$ | suy luận |
| Extreme reasoning | GPT-6 Astra / Claude Opus 5 | $$$$ | bài toán khó |
| Coding | Claude Sonnet / GPT / Gemini | $$ | code |
| Coding agent | Claude Sonnet 5 / GPT / Gemini 3.8 Flash | $$–$$$ | tool use |
| Codebase khổng lồ | Gemini / Claude / GPT | $$ | context lớn |
| OCR | Gemini / GPT / Claude | $–$$ | vision |
| Phân tích PDF | Gemini / GPT / Claude | $–$$ | multimodal |
| Dịch thuật | Gemini Flash / GPT Luna / DeepSeek | $ | rẻ |
| Phân loại hàng loạt | Flash / Luna / DeepSeek | rất thấp | throughput |
| RAG | Flash/Luna + embedding | $ | retrieval |
| Web research | reasoning + search | $$ | research |
| Deep research | frontier reasoning | $$$ | multi-step |
| Diagram | LLM → Mermaid | gần free | deterministic |
| Image | image model | $$ | visual |
| TTS | speech model | $ | voice |
| STT | transcription model | $ | audio |
| Video | video model | $$$ | đắt |
| Local / riêng tư | Qwen/Llama/Gemma/DeepSeek/Kimi | điện | privacy |
Providers — chi tiết & giá
Giá API theo $/triệu token — thay đổi khá nhanh, luôn xác nhận lại trên trang chính thức trước khi tính budget.
OpenAI
- GPT-6 Astra — Flagship, reasoning/coding khó nhất. Hardest reasoning, architecture; complex coding, research, agent; context ~1.05M tokens; tools: web search, file search, computer use. $10/M input · $50/M output
- GPT-5.6 Sol — Professional coding & reasoning. Architecture → PRD → implementation plan; coding khó, review; business analysis phức tạp. $4/M input · $20/M output
- GPT-5.6 Terra — Balanced, dùng hằng ngày. Coding thường ngày; document generation; reasoning mức trung bình, agent. $2/M input · $12/M output
- GPT-5.6 Luna — Cost-sensitive, backend rẻ. Classification, extraction, dịch; chat đơn giản, tóm tắt; bulk processing, sub-agent. $0.20/M input · $1.20/M output
Google Gemini
- Gemini 3.1 Pro — Deep reasoning & multimodal. Multimodal reasoning, docs khổng lồ; architecture, research, code phức tạp.
- Gemini 3.8 Flash — Agents & long-horizon engineering. Agents, coding, long-running tasks; high-volume reasoning.
- Gemini Flash-Lite — Cheap high-volume API. Classification, extraction, tóm tắt.
- Gemini 3.5 Transcribe — Audio → Text. Low latency, language detection; speaker diarization, word timestamps.
Lợi thế lớn nhất của Gemini: một provider phủ text + vision + audio + image + video — kèm search/grounding & hệ sinh thái Google.
Anthropic Claude
- Claude Sonnet 5 — AI Software Engineer. Model agentic nhất dòng Sonnet; read repo → plan → edit → test → fix → PR; long documents, professional writing. $2/M input · $10/M output (có prompt caching/batch)
- Claude Opus 5 — Frontier, khi việc thật khó. Problem cực khó, large refactor; architecture, complex reasoning; không dùng cho việc đơn giản như dịch 1 câu.
Khác (xAI · DeepSeek · Kimi)
- Grok 4.6 (xAI) — Long-running agents, real-time. Reasoning, coding, agents; real-time info ecosystem, ảnh/video/speech; Grok Voice Transcribe 2.0 — STT.
- DeepSeek V4.x — Cost/performance tối ưu. Coding, reasoning, bulk processing; V4.1 Flash — rất rẻ cho high-volume; backend cho pipeline hàng chục nghìn item.
- Kimi K3 / K2.7-Code — Long context & coding, open-weight. 2.8T params, context tới 1M tokens; K2.7-Code giảm mạnh reasoning tokens; codebase & document lớn, agent.
Token, Thinking Token & Chi phí
Token ≠ Word
Không có công thức chuyển đổi chính xác. Rule-of-thumb tiếng Anh: 1 token ≈ 0.75 từ hoặc 1 từ ≈ 1.3 token. Code, JSON, tiếng Trung, tiếng Việt token hóa khác đáng kể — billing luôn nên tính theo token, không theo từ.
Thinking token
input = 2,000 tokens
thinking = 8,000 tokens (có thể không hiển thị nhưng vẫn tính phí)
answer = 1,000 tokens
Một số model (vd. Gemini) tính thinking token vào phần output pricing — luôn kiểm tra bảng giá chính thức.
Công thức tính chi phí
giá: $2 / 1M input · $10 / 1M output
request: input = 100K · output = 20K
chi phí input = 100K × $2 / 1M = $0.20
chi phí output = 20K × $10 / 1M = $0.20
tổng = $0.40
✓ API KHÔNG NHẤT THIẾT ĐẮT Model $0.20/M input + $1.20/M output, xử lý 1M input + 100K output → chỉ ~$0.32. AI app có thể rất rẻ nếu routing model đúng task.
Credit là gì
- Token — đơn vị usage thực tế (input/output/reasoning/image/audio/video)
- Credit — tiền/usage balance do platform quy đổi — abstraction của billing
- Lưu ý — 10 credit ≠ 10 token — không quy đổi 1:1
3 kiểu pricing
| Kiểu | Mô tả | Phù hợp |
|---|---|---|
| Pay-as-you-go | Trả đúng theo token tiêu thụ | developer, startup, prototype, backend |
| Monthly subscription | $20–100/tháng, thường không tương đương credit API | Chat UI, coding assistant, consumer |
| Enterprise / committed | Reserved capacity + SLA + security | production enterprise |
Kiến trúc Gateway & Model Router
Đừng gọi thẳng 1 provider. Xây Gateway → Router → nhiều provider + fallback.
Application → AI Gateway → Model Router
├── OpenAI
├── Anthropic
├── Google Gemini
├── xAI Grok
├── DeepSeek
├── Moonshot Kimi
└── Local Ollama
Provider abstraction
interface AIProvider {
chat(request: ChatRequest): Promise<ChatResponse>;
stream(request: ChatRequest): AsyncIterable<ChatChunk>;
}
// implement:
OpenAIProvider · ClaudeProvider · GeminiProvider
GrokProvider · DeepSeekProvider · KimiProvider · OllamaProvider
// application không cần biết đang gọi provider nào
Routing config mẫu
tasks:
simple_chat:
primary: gpt-5.6-luna
fallback: [gemini-3.5-flash-lite, deepseek]
coding:
primary: claude-sonnet-5
fallback: [gpt-5.6-sol, gemini-3.8-flash]
deep_reasoning:
primary: gpt-6-astra
fallback: [claude-opus-5, gemini-3.1-pro]
translation:
primary: gemini-flash
fallback: [gpt-5.6-luna]
ocr:
primary: gemini
fallback: [gpt]
speech_to_text:
primary: gemini-transcribe
fallback: [grok-transcribe]
Diagram: đừng luôn dùng Image AI
LLM → Mermaid syntax → SVG / PNG
Deterministic · version control · Git-friendly · editable. Image AI chỉ dùng khi cần minh họa marketing/infographic/art.
Chiến lược chọn Tier
Không phải “model mới nhất = luôn dùng”. Chọn “good enough + rẻ + đáng tin cậy” khi có thể.
Quy tắc 80 / 15 / 5
| Tỷ lệ | Tier | Models |
|---|---|---|
| 80% | Cheap | Luna, Gemini Flash, DeepSeek, Kimi, Local |
| 15% | Professional | Claude Sonnet, GPT Terra/Sol, Gemini Pro |
| 5% | Frontier | GPT Astra, Claude Opus, Gemini flagship |
Không phải tỷ lệ bắt buộc — là kiến trúc cost-control nên hướng tới.
Model cũ vẫn có giá trị
Model mới nhất ra mắt → Benchmark task thực tế
├── Model cũ pass được → Dùng model cũ, rẻ hơn
└── Không pass → Dùng model mới
Model cũ (Claude 4.x, GPT-5.x, Gemini thế hệ trước) vẫn rất tốt cho: summarization, extraction, translation, classification, coding đơn giản.
6 loại chi phí cần theo dõi
- Input tokens
- Output tokens
- Reasoning / thinking tokens
- Context / cache
- Tool calls
- Image / audio / video generation
▲ AGENT COST ≠ SINGLE CALL COST Một agent request (search → read file → terminal → fix) có thể tạo ra hàng chục API call. Tính cost theo toàn bộ chuỗi, không theo 1 lần gọi.
Theo dõi & Vận hành AI Gateway
Log đủ field để có dashboard cost/quality/latency theo thời gian thực.
Field nên log mỗi request
request_id · user_id · task_type
provider · model
input_tokens · output_tokens · reasoning_tokens
latency · cost · success · error · fallback_count
Dashboard nên có
- Cost — Cost by provider · Cost by model · Cost by task
- Volume — Tokens/day · Fallback rate
- Reliability — Average latency · Error rate
- Quality — Quality score theo task
Router + Evaluation, không phải “cảm tính”
Đừng quyết định “Claude tốt hơn GPT” theo cảm tính — benchmark trên chính workload của bạn. Ví dụ 100 task mẫu: Coding 25 · Reasoning 20 · Documents 20 · Translation 10 · OCR 10 · Agent 10 · Other 5.
Model A → Quality 91 · Cost $$ · Latency medium
Model B → Quality 89 · Cost $ · Latency fast
Router quyết định: task đơn giản → B, task quan trọng → A
Đây mới là AI engineering — không phải chỉ “chọn model mạnh nhất”.
Ma trận quyết định tổng hợp
Bảng tra 1 phát: đang làm gì → dùng model nào → backup nào.
| Task | Primary | Backup |
|---|---|---|
| Chat thường | GPT Luna | Gemini Flash |
| Học tiếng Anh | GPT / Claude | Gemini |
| Dịch thuật | Gemini Flash | GPT Luna |
| Document | Claude Sonnet | GPT Terra |
| Architecture | GPT Sol | Claude Sonnet |
| Deep reasoning | GPT Astra | Claude Opus |
| Coding | Claude Sonnet | GPT Sol |
| Coding agent | Claude Sonnet | GPT Sol |
| Repo khổng lồ | Gemini / Claude | GPT |
| OCR | Gemini | GPT |
| Gemini | Claude | |
| RAG | Gemini/GPT + embeddings | local |
| Bulk rẻ | DeepSeek | Luna |
| Private AI | Ollama | — |
| STT | Gemini Transcribe | Grok Transcribe |
| TTS | specialized TTS | local Qwen |
| Diagram | LLM → Mermaid | image model |
| Image | image model | Gemini image |
| Video | video model | — |
AI Model Stack Reference · nội dung tổng hợp từ khảo sát model/API — pricing & model name thay đổi nhanh, luôn xác nhận lại trên trang provider trước khi đưa vào production.