Skip to main content
AIConnect
← Blog

AI Model Stack — Multi-Provider Reference

Cheatsheet thực dụng cho việc chọn & định tuyến model AI theo capability → workload → cost → provider → fallback.

✦ View the full interactive version

Cheatsheet thực dụng cho việc chọn & định tuyến model AI theo capability → workload → cost → provider → fallback.

◆ INSIGHT CHÍNH Đừng chọn “một model tốt nhất”. Một model mạnh nhất cho reasoning chưa chắc tốt nhất cho TTS/video/OCR. Hãy xây AI Model Router: chọn model theo từng loại task, không theo tên hãng.

Vòng lặp quyết định

Request vào → Gateway → Model Router
  ├── chat / dịch        → Tier rẻ          (Luna · Flash · DeepSeek)
  ├── code / agent       → Tier chuyên nghiệp (Claude Sonnet · GPT Sol)
  ├── reasoning khó      → Tier frontier     (GPT Astra · Claude Opus)
  └── riêng tư / offline → Local             (Ollama · Qwen · Llama)
→ Response

Application không gọi thẳng 1 provider — mọi request đi qua Gateway rồi Router quyết định model.

4 tầng của Stack

TầngModelsChi phí
① FRONTIERGPT-6 Astra · Claude Opus 5 · Gemini 3.1 Pro flagship — bài toán khó nhất, ~5–10% workload$$$$
② PROFESSIONALGPT-5.6 Sol/Terra · Claude Sonnet 5 · Gemini Pro — coding, agent, công việc quan trọng$$–$$$
③ CHEAP CLOUDGPT-5.6 Luna · Gemini Flash/Lite · DeepSeek · Kimi — ~80% workload thường ngày$
④ LOCALOllama · Qwen · Llama · Gemma — riêng tư, offline, thử nghiệm≈ điện

Dùng sheet này thế nào

  • 01 Phân loại — 17 loại nhiệm vụ AI (chat, reasoning, OCR, TTS, video…)
  • 02 Task→Model — bảng tra nhanh: task nào dùng model family nào, giá bao nhiêu
  • 03 Providers — chi tiết từng hãng: OpenAI, Google, Anthropic, xAI, DeepSeek, Kimi
  • 04 Token & Chi phí — token, thinking token, credit, công thức tính giá
  • 05 Kiến trúc — sơ đồ Gateway/Router + config YAML mẫu
  • 06 Chiến lược Tier — quy tắc 80/15/5, khi nào dùng model cũ
  • 07 Vận hành — field cần log, 6 loại chi phí của agent
  • 08 Ma trận — bảng quyết định cuối cùng, tra 1 phát ra model

Phân loại Model theo Capability

Đừng nhìn model theo tên hãng — chia theo năng lực thực hiện.

17 loại nhiệm vụ

LoạiNhiệm vụ chínhVí dụ model
General Chat / FastChat, Q&A, rewrite, dịchGPT-5.6 Luna, Gemini Flash, Claude Sonnet
ReasoningPhân tích nhiều bướcGPT-5.6 Sol, Gemini Pro, Claude
Deep Thinking / FrontierBài toán khó, architecture, researchGPT-6 Astra, Claude Opus 5, Gemini Pro
Long ContextĐọc codebase/docs lớnGemini, Claude, GPT
CodingSinh code / debug / refactorClaude Sonnet, GPT, Gemini
Agentic CodingCode + terminal + browser + toolsClaude Sonnet 5, GPT, Gemini 3.8 Flash
Vision / OCRẢnh/PDF/screenshot → textGemini, GPT, Claude
Image GenerationẢnh/diagram/art/UIGemini image, GPT image, Grok Imagine
Diagram GenerationArchitecture/flowchart/UMLLLM → Mermaid/SVG hoặc image model
Speech-to-TextAudio → textGemini Transcribe, Grok Voice Transcribe
Text-to-SpeechText → voiceGemini/Grok/OpenAI/ElevenLabs
Realtime VoiceNói chuyện trực tiếpGemini Live, realtime models
Video GenerationText/ảnh → videoGemini video, Grok Imagine, Veo-family
EmbeddingSemantic search / RAGembedding models
RerankerXếp hạng lại kết quả searchspecialized rerankers
Moderation / SafetyPhát hiện nội dung độc hạiprovider moderation models
Small / LocalRiêng tư / offline / rẻLlama, Qwen, Gemma, DeepSeek/Kimi open

▲ CHAT ≠ REASONING ≠ THINKING “What is REST API?” → dùng tier rẻ (Flash/Luna). “Thiết kế architecture cho 10 triệu user” → cần reasoning model. “Phân tích ràng buộc, so sánh 4 kiến trúc, ước lượng failure mode, viết ADR” → cần deep reasoning / frontier.

Bản đồ Task → Model Family

Tra nhanh: đang làm task gì thì nên gọi nhóm model nào, tốn khoảng bao nhiêu.

TaskModel family nên xem xétCostĐặc tính
Chat bình thườngLuna / Flash / Sonnet$nhanh
Chat chất lượng caoClaude Sonnet / GPT Terra$$cân bằng
Deep reasoningGPT Sol / Gemini Pro / Claude Opus$$$suy luận
Extreme reasoningGPT-6 Astra / Claude Opus 5$$$$bài toán khó
CodingClaude Sonnet / GPT / Gemini$$code
Coding agentClaude Sonnet 5 / GPT / Gemini 3.8 Flash$$–$$$tool use
Codebase khổng lồGemini / Claude / GPT$$context lớn
OCRGemini / GPT / Claude$–$$vision
Phân tích PDFGemini / GPT / Claude$–$$multimodal
Dịch thuậtGemini Flash / GPT Luna / DeepSeek$rẻ
Phân loại hàng loạtFlash / Luna / DeepSeekrất thấpthroughput
RAGFlash/Luna + embedding$retrieval
Web researchreasoning + search$$research
Deep researchfrontier reasoning$$$multi-step
DiagramLLM → Mermaidgần freedeterministic
Imageimage model$$visual
TTSspeech model$voice
STTtranscription model$audio
Videovideo model$$$đắt
Local / riêng tưQwen/Llama/Gemma/DeepSeek/Kimiđiệnprivacy

Providers — chi tiết & giá

Giá API theo $/triệu token — thay đổi khá nhanh, luôn xác nhận lại trên trang chính thức trước khi tính budget.

OpenAI

  • GPT-6 Astra — Flagship, reasoning/coding khó nhất. Hardest reasoning, architecture; complex coding, research, agent; context ~1.05M tokens; tools: web search, file search, computer use. $10/M input · $50/M output
  • GPT-5.6 Sol — Professional coding & reasoning. Architecture → PRD → implementation plan; coding khó, review; business analysis phức tạp. $4/M input · $20/M output
  • GPT-5.6 Terra — Balanced, dùng hằng ngày. Coding thường ngày; document generation; reasoning mức trung bình, agent. $2/M input · $12/M output
  • GPT-5.6 Luna — Cost-sensitive, backend rẻ. Classification, extraction, dịch; chat đơn giản, tóm tắt; bulk processing, sub-agent. $0.20/M input · $1.20/M output

Google Gemini

  • Gemini 3.1 Pro — Deep reasoning & multimodal. Multimodal reasoning, docs khổng lồ; architecture, research, code phức tạp.
  • Gemini 3.8 Flash — Agents & long-horizon engineering. Agents, coding, long-running tasks; high-volume reasoning.
  • Gemini Flash-Lite — Cheap high-volume API. Classification, extraction, tóm tắt.
  • Gemini 3.5 Transcribe — Audio → Text. Low latency, language detection; speaker diarization, word timestamps.

Lợi thế lớn nhất của Gemini: một provider phủ text + vision + audio + image + video — kèm search/grounding & hệ sinh thái Google.

Anthropic Claude

  • Claude Sonnet 5 — AI Software Engineer. Model agentic nhất dòng Sonnet; read repo → plan → edit → test → fix → PR; long documents, professional writing. $2/M input · $10/M output (có prompt caching/batch)
  • Claude Opus 5 — Frontier, khi việc thật khó. Problem cực khó, large refactor; architecture, complex reasoning; không dùng cho việc đơn giản như dịch 1 câu.

Khác (xAI · DeepSeek · Kimi)

  • Grok 4.6 (xAI) — Long-running agents, real-time. Reasoning, coding, agents; real-time info ecosystem, ảnh/video/speech; Grok Voice Transcribe 2.0 — STT.
  • DeepSeek V4.x — Cost/performance tối ưu. Coding, reasoning, bulk processing; V4.1 Flash — rất rẻ cho high-volume; backend cho pipeline hàng chục nghìn item.
  • Kimi K3 / K2.7-Code — Long context & coding, open-weight. 2.8T params, context tới 1M tokens; K2.7-Code giảm mạnh reasoning tokens; codebase & document lớn, agent.

Token, Thinking Token & Chi phí

Token ≠ Word

Không có công thức chuyển đổi chính xác. Rule-of-thumb tiếng Anh: 1 token ≈ 0.75 từ hoặc 1 từ ≈ 1.3 token. Code, JSON, tiếng Trung, tiếng Việt token hóa khác đáng kể — billing luôn nên tính theo token, không theo từ.

Thinking token

input    = 2,000 tokens
thinking = 8,000 tokens  (có thể không hiển thị nhưng vẫn tính phí)
answer   = 1,000 tokens

Một số model (vd. Gemini) tính thinking token vào phần output pricing — luôn kiểm tra bảng giá chính thức.

Công thức tính chi phí

giá: $2 / 1M input · $10 / 1M output
request: input = 100K · output = 20K
chi phí input  = 100K × $2 / 1M  = $0.20
chi phí output = 20K × $10 / 1M  = $0.20
tổng           = $0.40

✓ API KHÔNG NHẤT THIẾT ĐẮT Model $0.20/M input + $1.20/M output, xử lý 1M input + 100K output → chỉ ~$0.32. AI app có thể rất rẻ nếu routing model đúng task.

Credit là gì

  • Token — đơn vị usage thực tế (input/output/reasoning/image/audio/video)
  • Credit — tiền/usage balance do platform quy đổi — abstraction của billing
  • Lưu ý — 10 credit ≠ 10 token — không quy đổi 1:1

3 kiểu pricing

KiểuMô tảPhù hợp
Pay-as-you-goTrả đúng theo token tiêu thụdeveloper, startup, prototype, backend
Monthly subscription$20–100/tháng, thường không tương đương credit APIChat UI, coding assistant, consumer
Enterprise / committedReserved capacity + SLA + securityproduction enterprise

Kiến trúc Gateway & Model Router

Đừng gọi thẳng 1 provider. Xây Gateway → Router → nhiều provider + fallback.

Application → AI Gateway → Model Router
  ├── OpenAI
  ├── Anthropic
  ├── Google Gemini
  ├── xAI Grok
  ├── DeepSeek
  ├── Moonshot Kimi
  └── Local Ollama

Provider abstraction

interface AIProvider {
  chat(request: ChatRequest): Promise<ChatResponse>;
  stream(request: ChatRequest): AsyncIterable<ChatChunk>;
}

// implement:
OpenAIProvider · ClaudeProvider · GeminiProvider
GrokProvider · DeepSeekProvider · KimiProvider · OllamaProvider

// application không cần biết đang gọi provider nào

Routing config mẫu

tasks:

  simple_chat:
    primary: gpt-5.6-luna
    fallback: [gemini-3.5-flash-lite, deepseek]

  coding:
    primary: claude-sonnet-5
    fallback: [gpt-5.6-sol, gemini-3.8-flash]

  deep_reasoning:
    primary: gpt-6-astra
    fallback: [claude-opus-5, gemini-3.1-pro]

  translation:
    primary: gemini-flash
    fallback: [gpt-5.6-luna]

  ocr:
    primary: gemini
    fallback: [gpt]

  speech_to_text:
    primary: gemini-transcribe
    fallback: [grok-transcribe]

Diagram: đừng luôn dùng Image AI

LLM → Mermaid syntax → SVG / PNG

Deterministic · version control · Git-friendly · editable. Image AI chỉ dùng khi cần minh họa marketing/infographic/art.

Chiến lược chọn Tier

Không phải “model mới nhất = luôn dùng”. Chọn “good enough + rẻ + đáng tin cậy” khi có thể.

Quy tắc 80 / 15 / 5

Tỷ lệTierModels
80%CheapLuna, Gemini Flash, DeepSeek, Kimi, Local
15%ProfessionalClaude Sonnet, GPT Terra/Sol, Gemini Pro
5%FrontierGPT Astra, Claude Opus, Gemini flagship

Không phải tỷ lệ bắt buộc — là kiến trúc cost-control nên hướng tới.

Model cũ vẫn có giá trị

Model mới nhất ra mắt → Benchmark task thực tế
  ├── Model cũ pass được  → Dùng model cũ, rẻ hơn
  └── Không pass          → Dùng model mới

Model cũ (Claude 4.x, GPT-5.x, Gemini thế hệ trước) vẫn rất tốt cho: summarization, extraction, translation, classification, coding đơn giản.

6 loại chi phí cần theo dõi

  1. Input tokens
  2. Output tokens
  3. Reasoning / thinking tokens
  4. Context / cache
  5. Tool calls
  6. Image / audio / video generation

▲ AGENT COST ≠ SINGLE CALL COST Một agent request (search → read file → terminal → fix) có thể tạo ra hàng chục API call. Tính cost theo toàn bộ chuỗi, không theo 1 lần gọi.

Theo dõi & Vận hành AI Gateway

Log đủ field để có dashboard cost/quality/latency theo thời gian thực.

Field nên log mỗi request

request_id · user_id · task_type
provider · model
input_tokens · output_tokens · reasoning_tokens
latency · cost · success · error · fallback_count

Dashboard nên có

  • Cost — Cost by provider · Cost by model · Cost by task
  • Volume — Tokens/day · Fallback rate
  • Reliability — Average latency · Error rate
  • Quality — Quality score theo task

Router + Evaluation, không phải “cảm tính”

Đừng quyết định “Claude tốt hơn GPT” theo cảm tính — benchmark trên chính workload của bạn. Ví dụ 100 task mẫu: Coding 25 · Reasoning 20 · Documents 20 · Translation 10 · OCR 10 · Agent 10 · Other 5.

Model A → Quality 91 · Cost $$ · Latency medium
Model B → Quality 89 · Cost $  · Latency fast
Router quyết định: task đơn giản → B, task quan trọng → A

Đây mới là AI engineering — không phải chỉ “chọn model mạnh nhất”.

Ma trận quyết định tổng hợp

Bảng tra 1 phát: đang làm gì → dùng model nào → backup nào.

TaskPrimaryBackup
Chat thườngGPT LunaGemini Flash
Học tiếng AnhGPT / ClaudeGemini
Dịch thuậtGemini FlashGPT Luna
DocumentClaude SonnetGPT Terra
ArchitectureGPT SolClaude Sonnet
Deep reasoningGPT AstraClaude Opus
CodingClaude SonnetGPT Sol
Coding agentClaude SonnetGPT Sol
Repo khổng lồGemini / ClaudeGPT
OCRGeminiGPT
PDFGeminiClaude
RAGGemini/GPT + embeddingslocal
Bulk rẻDeepSeekLuna
Private AIOllama—
STTGemini TranscribeGrok Transcribe
TTSspecialized TTSlocal Qwen
DiagramLLM → Mermaidimage model
Imageimage modelGemini image
Videovideo model—

AI Model Stack Reference · nội dung tổng hợp từ khảo sát model/API — pricing & model name thay đổi nhanh, luôn xác nhận lại trên trang provider trước khi đưa vào production.