Cheatsheet thực dụng cho việc chọn & định tuyến model AI theo capability → workload → cost → provider → fallback. Dựa trên tình trạng model/API kiểm tra ngày 21/09/2026.
flowchart LR
A["Request vào"] --> B["Gateway"]
B --> C["Model Router"]
C --> D{"Loại task?"}
D -->|"chat / dịch"| E["Tier rẻ
Luna · Flash · DeepSeek"]
D -->|"code / agent"| F["Tier chuyên nghiệp
Claude Sonnet · GPT Sol"]
D -->|"reasoning khó"| G["Tier frontier
GPT Astra · Claude Opus"]
D -->|"riêng tư / offline"| H["Local
Ollama · Qwen · Llama"]
E --> I["Response"]
F --> I
G --> I
H --> I
Đừng nhìn model theo tên hãng — chia theo năng lực thực hiện.
| Loại | Nhiệm vụ chính | Ví dụ model |
|---|---|---|
| General Chat / Fast | Chat, Q&A, rewrite, dịch | GPT-5.6 Luna, Gemini Flash, Claude Sonnet |
| Reasoning | Phân tích nhiều bước | GPT-5.6 Sol, Gemini Pro, Claude |
| Deep Thinking / Frontier | Bài toán khó, architecture, research | GPT-6 Astra, Claude Opus 5, Gemini Pro |
| Long Context | Đọc codebase/docs lớn | Gemini, Claude, GPT |
| Coding | Sinh code / debug / refactor | Claude Sonnet, GPT, Gemini |
| Agentic Coding | Code + terminal + browser + tools | Claude Sonnet 5, GPT, Gemini 3.8 Flash |
| Vision / OCR | Ảnh/PDF/screenshot → text | Gemini, GPT, Claude |
| Image Generation | Ảnh/diagram/art/UI | Gemini image, GPT image, Grok Imagine |
| Diagram Generation | Architecture/flowchart/UML | LLM → Mermaid/SVG hoặc image model |
| Speech-to-Text | Audio → text | Gemini Transcribe, Grok Voice Transcribe |
| Text-to-Speech | Text → voice | Gemini/Grok/OpenAI/ElevenLabs |
| Realtime Voice | Nói chuyện trực tiếp | Gemini Live, realtime models |
| Video Generation | Text/ảnh → video | Gemini video, Grok Imagine, Veo-family |
| Embedding | Semantic search / RAG | embedding models |
| Reranker | Xếp hạng lại kết quả search | specialized rerankers |
| Moderation / Safety | Phát hiện nội dung độc hại | provider moderation models |
| Small / Local | Riêng tư / offline / rẻ | Llama, Qwen, Gemma, DeepSeek/Kimi open |
Tra nhanh: đang làm task gì thì nên gọi nhóm model nào, tốn khoảng bao nhiêu.
| Task | Model family nên xem xét | Cost | Đặc tính |
|---|---|---|---|
| Chat bình thường | Luna / Flash / Sonnet | $ | nhanh |
| Chat chất lượng cao | Claude Sonnet / GPT Terra | $$ | cân bằng |
| Deep reasoning | GPT Sol / Gemini Pro / Claude Opus | $$$ | suy luận |
| Extreme reasoning | GPT-6 Astra / Claude Opus 5 | $$$$ | bài toán khó |
| Coding | Claude Sonnet / GPT / Gemini | $$ | code |
| Coding agent | Claude Sonnet 5 / GPT / Gemini 3.8 Flash | $$–$$$ | tool use |
| Codebase khổng lồ | Gemini / Claude / GPT | $$ | context lớn |
| OCR | Gemini / GPT / Claude | $–$$ | vision |
| Phân tích PDF | Gemini / GPT / Claude | $–$$ | multimodal |
| Dịch thuật | Gemini Flash / GPT Luna / DeepSeek | $ | rẻ |
| Phân loại hàng loạt | Flash / Luna / DeepSeek | rất thấp | throughput |
| RAG | Flash/Luna + embedding | $ | retrieval |
| Web research | reasoning + search | $$ | research |
| Deep research | frontier reasoning | $$$ | multi-step |
| Diagram | LLM → Mermaid | gần free | deterministic |
| Image | image model | $$ | visual |
| TTS | speech model | $ | voice |
| STT | transcription model | $ | audio |
| Video | video model | $$$ | đắt |
| Local / riêng tư | Qwen/Llama/Gemma/DeepSeek/Kimi | điện | privacy |
Giá API theo $/triệu token, kiểm tra 21/09/2026 — thay đổi khá nhanh, luôn xác nhận lại trên trang chính thức trước khi tính budget.
Flagship — reasoning/coding khó nhất
Professional coding & reasoning
Balanced — dùng hằng ngày
Cost-sensitive — backend rẻ
Deep reasoning & multimodal
Agents & long-horizon engineering
Cheap high-volume API
Audio → Text
Lợi thế lớn nhất của Gemini: một provider phủ text + vision + audio + image + video — kèm search/grounding & hệ sinh thái Google.
AI Software Engineer
Frontier — khi việc thật khó
Long-running agents, real-time
Cost/performance tối ưu
Long context & coding, open-weight
Hiểu đúng đơn vị billing trước khi thiết kế budget cho AI stack.
Không có công thức chuyển đổi chính xác. Rule-of-thumb tiếng Anh: 1 token ≈ 0.75 từ hoặc 1 từ ≈ 1.3 token. Code, JSON, tiếng Trung, tiếng Việt token hóa khác đáng kể — billing luôn nên tính theo token, không theo từ.
Một số model (vd. Gemini) tính thinking token vào phần output pricing — luôn kiểm tra bảng giá chính thức.
| Kiểu | Mô tả | Phù hợp |
|---|---|---|
| Pay-as-you-go | Trả đúng theo token tiêu thụ | developer, startup, prototype, backend |
| Monthly subscription | $20–100/tháng, thường không tương đương credit API | Chat UI, coding assistant, consumer |
| Enterprise / committed | Reserved capacity + SLA + security | production enterprise |
Đừng gọi thẳng 1 provider. Xây Gateway → Router → nhiều provider + fallback.
flowchart TD
APP["Application"] --> GW["AI Gateway"]
GW --> ROUTER["Model Router"]
ROUTER --> OAI["OpenAI"]
ROUTER --> ANT["Anthropic"]
ROUTER --> GGL["Google Gemini"]
ROUTER --> XAI["xAI Grok"]
ROUTER --> DS["DeepSeek"]
ROUTER --> KIMI["Moonshot Kimi"]
ROUTER --> LOCAL["Local Ollama"]
interface AIProvider { chat(request: ChatRequest): Promise<ChatResponse>; stream(request: ChatRequest): AsyncIterable<ChatChunk>; } // implement: OpenAIProvider · ClaudeProvider · GeminiProvider GrokProvider · DeepSeekProvider · KimiProvider · OllamaProvider // application không cần biết đang gọi provider nào
tasks: simple_chat: primary: gpt-5.6-luna fallback: [gemini-3.5-flash-lite, deepseek] coding: primary: claude-sonnet-5 fallback: [gpt-5.6-sol, gemini-3.8-flash] deep_reasoning: primary: gpt-6-astra fallback: [claude-opus-5, gemini-3.1-pro] translation: primary: gemini-flash fallback: [gpt-5.6-luna] ocr: primary: gemini fallback: [gpt] speech_to_text: primary: gemini-transcribe fallback: [grok-transcribe]
flowchart LR
L["LLM"] --> M["Mermaid syntax"] --> S["SVG / PNG"]
Không phải "model mới nhất = luôn dùng". Chọn "good enough + rẻ + đáng tin cậy" khi có thể.
Không phải tỷ lệ bắt buộc — là kiến trúc cost-control nên hướng tới.
flowchart TD
NEW["Model mới nhất ra mắt"] --> BM["Benchmark task thực tế"]
BM --> Q{"Model cũ có
pass được không?"}
Q -->|"Có"| OLD["Dùng model cũ, rẻ hơn"]
Q -->|"Không"| NEWM["Dùng model mới"]
Model cũ (Claude 4.x, GPT-5.x, Gemini thế hệ trước) vẫn rất tốt cho: summarization, extraction, translation, classification, coding đơn giản.
| # | Loại chi phí |
|---|---|
| 1 | Input tokens |
| 2 | Output tokens |
| 3 | Reasoning / thinking tokens |
| 4 | Context / cache |
| 5 | Tool calls |
| 6 | Image / audio / video generation |
Log đủ field để có dashboard cost/quality/latency theo thời gian thực.
request_id · user_id · task_type provider · model input_tokens · output_tokens · reasoning_tokens latency · cost · success · error · fallback_count
Đừng quyết định "Claude tốt hơn GPT" theo cảm tính — benchmark trên chính workload của bạn. Ví dụ 100 task mẫu: Coding 25 · Reasoning 20 · Documents 20 · Translation 10 · OCR 10 · Agent 10 · Other 5.
Đây mới là AI engineering — không phải chỉ "chọn model mạnh nhất".
Bảng tra 1 phát: đang làm gì → dùng model nào → backup nào.
| Task | Primary | Backup |
|---|---|---|
| Chat thường | GPT Luna | Gemini Flash |
| Học tiếng Anh | GPT / Claude | Gemini |
| Dịch thuật | Gemini Flash | GPT Luna |
| Document | Claude Sonnet | GPT Terra |
| Architecture | GPT Sol | Claude Sonnet |
| Deep reasoning | GPT Astra | Claude Opus |
| Coding | Claude Sonnet | GPT Sol |
| Coding agent | Claude Sonnet | GPT Sol |
| Repo khổng lồ | Gemini / Claude | GPT |
| OCR | Gemini | GPT |
| Gemini | Claude | |
| RAG | Gemini/GPT + embeddings | local |
| Bulk rẻ | DeepSeek | Luna |
| Private AI | Ollama | — |
| STT | Gemini Transcribe | Grok Transcribe |
| TTS | specialized TTS | local Qwen |
| Diagram | LLM → Mermaid | image model |
| Image | image model | Gemini image |
| Video | video model | — |