AI Engineer Master Course
Trang chủ / Module 17
🧰 Module 17 / 17 · Tra cứu khi cần

Phụ lục: Công cụ & Thư viện tham khảo

Tổng hợp toàn bộ tool/thư viện dùng xuyên suốt khoá học kèm link tài liệu, ghi chú hiệu năng, và cấu hình máy đề xuất — dùng làm trang tra cứu nhanh.

ToolsHạ tầngCấu hình máy
📌 Vì sao module này quan trọng

Chương này không dạy khái niệm mới — nó là bảng tra cứu tổng hợp mọi công cụ/thư viện đã xuất hiện xuyên suốt 16 module, kèm link tài liệu chính thức và ghi chú thực tế về hiệu năng/cấu hình máy. Quay lại đây bất cứ khi nào cần chọn công cụ cho một bài toán cụ thể, hoặc cần biết máy của bạn có đủ mạnh để chạy một phần việc nào đó (đặc biệt là chạy model AI cục bộ) hay không.

🎯 Mục tiêu học tập

  • Biết cấu hình máy tối thiểu/khuyến nghị cho từng loại công việc trong khoá học
  • Có một bảng tra cứu nhanh công cụ/thư viện theo từng nhóm chức năng, không cần nhớ thuộc lòng
  • Hiểu khi nào nên gọi API cloud, khi nào nên tự host model cục bộ, và cấu hình phần cứng cần thiết cho từng lựa chọn

1. Cấu hình máy tổng quan cho khoá học

Tin tốt: hơn 90% nội dung khoá học (Module 1-6, 9-16) chỉ cần gọi API cloud — không đòi hỏi GPU hay máy mạnh, vì toàn bộ việc "nặng" (chạy model) diễn ra trên server của nhà cung cấp. Chỉ khi bạn chủ động chọn tự host model/embedding cục bộ (một phần tuỳ chọn của Module 4, 7, 17) mới cần cấu hình mạnh hơn.

Nhu cầuCPURAMỔ đĩaGPU
Baseline — gọi API cloud, RAG/Agent qua FastAPI, Docker, pgvector nhỏ (<1 triệu vector) 4 nhân trở lên16GBSSD 256GB+Không cần
Data Engineering — chạy Airflow + Spark local (Module 12) để học, không phải cluster thật 8 nhân trở lên32GBSSD 512GB+Không cần
Local LLM nhỏ — chạy thử model 7B-8B quantized (Ollama) để học self-host 8 nhân trở lên16GBSSD 512GB (model chiếm 4-8GB/model)Không bắt buộc (chạy CPU được, chậm hơn); có GPU 8GB+ VRAM thì nhanh hơn nhiều
Local LLM lớn / fine-tuning nhẹ — model 30-70B quantized, hoặc fine-tune LoRA model nhỏ 12 nhân trở lên64GB+SSD 1TB+ NVMeGPU 24GB+ VRAM (vd. RTX 4090) hoặc thuê cloud GPU
💡 Khuyến nghị thực tế

Nếu máy hiện tại của bạn chỉ đạt mức Baseline, đừng vội mua GPU — 95% công việc AI Engineer ứng dụng thực tế (kể cả đi làm) dùng API cloud. Chỉ đầu tư GPU/máy mạnh khi bạn xác định rõ nhu cầu học sâu về self-hosting hoặc fine-tuning. Khi cần thử nghiệm với model lớn, thuê GPU cloud theo giờ (RunPod, Lambda Labs, Google Colab) luôn rẻ hơn mua máy trong giai đoạn học.

2. Ngôn ngữ, Runtime & Dev Tools nền tảng

Công cụDùng đểLink tài liệuGhi chú
Python 3.11+Ngôn ngữ chính toàn khoá họcdocs.python.orgƯu tiên 3.11/3.12 vì asyncio nhanh hơn đáng kể so với 3.9 trở xuống
uvTrình quản lý package/venv Python tốc độ caodocs.astral.sh/uvThay thế pip/poetry, cài dependency nhanh hơn 10-100 lần, đang trở thành chuẩn mới 2025-2026
FastAPIFramework API chính cho AI backendfastapi.tiangolo.comNhẹ, async-native, tích hợp Pydantic sẵn
Pydantic v2Validate dữ liệu, định nghĩa structured output schemadocs.pydantic.devv2 nhanh hơn v1 (core viết bằng Rust) — luôn dùng v2
Docker + Docker ComposeContainer hoá service, chạy multi-service stack localdocs.docker.com4GB RAM cấp riêng cho Docker Desktop là đủ cho stack thông thường
GitQuản lý phiên bảngit-scm.com/docKhông có gì khác biệt so với dùng cho PHP
VS Code + Claude Code / GitHub CopilotIDE + AI coding assistantdocs.claude.com/claude-codeDùng chính AI coding agent để tăng tốc học — vừa học vừa quan sát cách agent giải quyết vấn đề
Postman / Insomnia / httpieTest API thủ công khi debughttpie.io/docshttpie nhẹ, dùng tốt qua CLI, phù hợp thói quen terminal-first

3. LLM Provider SDKs & Model Gateway

Công cụDùng đểLink tài liệuGhi chú
Anthropic Python SDKGọi Claude APIdocs.anthropic.com/api/client-sdksHỗ trợ sẵn streaming, tool use, prompt caching
OpenAI Python SDKGọi GPT/Responses APIgithub.com/openai/openai-pythonSDK dùng chung cho cả Responses API mới và Chat Completions cũ
Google Gen AI SDKGọi Gemini APIai.google.dev/gemini-api/docs/sdksPackage mới hợp nhất (google-genai) thay cho SDK cũ
LiteLLMLớp abstraction gọi 100+ model provider qua 1 interface thống nhấtdocs.litellm.aiTiết kiệm công viết lớp abstraction thủ công (Module 5) — cân nhắc dùng thay vì tự viết nếu cần hỗ trợ nhiều provider
OpenRouterAPI gateway trung gian gọi nhiều model qua 1 API keyopenrouter.ai/docsTiện cho việc thử nghiệm/so sánh nhanh nhiều model khác nhà cung cấp

4. Agent & Orchestration Frameworks

Công cụDùng đểLink tài liệuGhi chú
LangGraphXây agent dạng state graph, checkpointinglangchain-ai.github.io/langgraphFramework chính dùng trong Module 8
LangChainThư viện tiện ích RAG/chain (text splitter, loader...)python.langchain.comDùng chọn lọc các module tiện ích, không nhất thiết dùng toàn bộ hệ sinh thái
Claude Agent SDKXây coding agent / long-running agentdocs.anthropic.comQuản lý context tự động tốt cho tác vụ dài
OpenAI Agents SDKXây agent trong hệ sinh thái OpenAIopenai.github.io/openai-agents-pythonCó tracing tích hợp sẵn
CrewAIMulti-agent theo mô hình "đội nhóm" vai tròdocs.crewai.comTrừu tượng hoá cao, dễ prototype

5. Vector Databases & Search

Công cụLink tài liệuHiệu năng / Ghi chú cấu hình
pgvectorgithub.com/pgvector/pgvectorHNSW index: ~1.5-2KB RAM/vector 1024 chiều ở m=16; 1 triệu vector ≈ 2GB RAM cho index
Qdrantqdrant.tech/documentationSelf-host: 4GB RAM đủ cho vài triệu vector với quantization bật; Docker image nhẹ
Pineconedocs.pinecone.ioFully-managed, không cần lo cấu hình máy — chỉ cần quan tâm chi phí theo số vector/truy vấn
Weaviateweaviate.io/developersSelf-host cần ~4-8GB RAM cho dataset học tập vừa phải
Chromadocs.trychroma.comNhẹ nhất, chạy embedded trong process Python — lựa chọn tốt để học/prototype nhanh trên laptop

6. Embedding & Reranking

Công cụLink tài liệuGhi chú
OpenAI / Voyage / Cohere / Gemini EmbeddingsXem link ở mục 3 (đi kèm SDK provider)Gọi qua API, không cần cấu hình máy
sentence-transformerssbert.netChạy embedding model mã nguồn mở (BGE, E5...) local — model nhỏ (~500MB) chạy tốt trên CPU, không cần GPU
Cohere Rerankdocs.cohere.com/docs/rerankAPI, không cần cấu hình máy
BGE Reranker (mã nguồn mở)huggingface.co/BAAI/bge-reranker-v2-m3Chạy được trên CPU (chậm hơn) hoặc GPU 4GB+ VRAM (nhanh)

7. MCP Tooling

Công cụLink tài liệuGhi chú
MCP Python SDKgithub.com/modelcontextprotocol/python-sdkSDK chính viết MCP server ở Module 9
MCP TypeScript SDKgithub.com/modelcontextprotocol/typescript-sdkLựa chọn thay thế nếu team thiên về Node.js
MCP Inspectormodelcontextprotocol.io — InspectorCông cụ debug MCP server qua giao diện web, chạy qua npx
Claude Desktopclaude.com/downloadHost phổ biến nhất để test MCP server cá nhân qua giao diện chat thật

8. Evaluation & Observability

Công cụLink tài liệuGhi chú
Ragasdocs.ragas.ioMã nguồn mở, chạy local, dùng cho Module 11
LangSmithdocs.smith.langchain.comSaaS, tích hợp chặt với LangChain/LangGraph
Braintrustbraintrust.dev/docsSaaS, mạnh về so sánh phiên bản (A/B) prompt/model
Arize Phoenixdocs.arize.com/phoenixMã nguồn mở, nền OpenTelemetry, tự host được, không gửi dữ liệu ra ngoài
Promptfoopromptfoo.dev/docsCLI nhẹ, phù hợp chạy regression test prompt trong CI/CD (Module 13)

9. Data Engineering Tools

Công cụLink tài liệuGhi chú cấu hình
Apache Airflowairflow.apache.org/docsChạy local qua Docker Compose cần ~4GB RAM cho scheduler+webserver+worker
Apache Spark (PySpark)spark.apache.org/docs/latestChạy local mode (không cluster) để học cần 8GB+ RAM dành riêng cho JVM
Databricks Community Editiondocs.databricks.comBản miễn phí chạy trên cloud của Databricks — không cần máy mạnh, chỉ cần trình duyệt
dbtdocs.getdbt.comTransform layer, nhẹ, chạy tốt trên mọi máy

10. Chạy LLM cục bộ — cấu hình máy chi tiết theo kích thước model

Phần quan trọng nhất nếu bạn muốn tự host model (bảo mật dữ liệu, học sâu về inference, hoặc giảm chi phí dài hạn cho khối lượng cực lớn). Nguyên tắc ước lượng nhanh: model quantize 4-bit (phổ biến nhất) cần VRAM/RAM xấp xỉ (số tỷ tham số) × 0.6-0.7 GB.

Kích thước modelVRAM GPU cần (4-bit)RAM CPU-only (chậm hơn 5-20 lần)Ví dụ model
7B – 9B6-8GB16GBLlama 3.1 8B, Qwen 2.5 7B
13B – 14B10-12GB24GBQwen 2.5 14B
30B – 34B20-24GB48GBQwen 2.5 32B, DeepSeek-Coder
70B40-48GB (hoặc 2× GPU 24GB)96GB+ (rất chậm)Llama 3.1/3.3 70B
100B+ (MoE)Thường cần multi-GPU chuyên dụng hoặc dùng qua API cloudKhông thực tế cho máy cá nhânDeepSeek-V3, Llama 4 Maverick
Công cụLink tài liệuPhù hợp khi
Ollamagithub.com/ollama/ollamaDễ dùng nhất, cài 1 lệnh, phù hợp học và prototype nhanh trên máy cá nhân (Mac/Windows/Linux)
LM Studiolmstudio.ai/docsCó giao diện đồ hoạ, phù hợp người mới, dễ so sánh nhiều model
llama.cppgithub.com/ggml-org/llama.cppHiệu năng CPU tốt nhất, chạy được trên phần cứng yếu (kể cả không GPU), nền tảng bên dưới Ollama
vLLMdocs.vllm.aiPhục vụ model ở quy mô production/throughput cao (nhiều request đồng thời), cần GPU thật, không phù hợp laptop cá nhân
⚠️ Đừng nhầm lẫn mục tiêu

Chạy local LLM để học cách hoạt động (Module 4) khác với chạy local LLM để thay thế API cloud trong production (Module 10, 13). Với production, chỉ tự host khi có lý do rõ ràng (bảo mật dữ liệu bắt buộc, chi phí ở quy mô cực lớn đã tính toán kỹ) — vận hành GPU cluster đáng tin cậy phức tạp hơn nhiều so với gọi API.

11. Cloud & DevOps Tools

Công cụLink tài liệuGhi chú
AWS CLI + Bedrockdocs.aws.amazon.com/bedrockModel gateway đa nhà cung cấp trên AWS
Azure CLI + AI Foundrylearn.microsoft.com/azure/ai-foundryPhù hợp hệ sinh thái doanh nghiệp Microsoft
gcloud CLI + Vertex AIcloud.google.com/vertex-ai/docsTích hợp chặt với Gemini
kubectl + Kuberneteskubernetes.io/docsminikube/kind đủ dùng để học local, cần 4GB RAM riêng cho cluster
Terraformdeveloper.hashicorp.com/terraformInfrastructure-as-code, nên học cơ bản để tự động hoá deploy hạ tầng AI
GitHub Actionsdocs.github.com/actionsCI/CD phổ biến nhất để chạy regression eval tự động (Module 11, 13)

🏋️ Bài tập thực hành

Thiết lập môi trường phát triển đầy đủ

Cài đặt trên máy của bạn: Python 3.11+ qua uv, Docker Desktop, VS Code + Claude Code. Chạy thử Ollama với 1 model 7-8B (ví dụ Llama 3.1 8B) để tự đo tốc độ sinh token trên máy bạn (CPU-only so với có GPU nếu có). Cài MCP Inspector qua npx và thử kết nối với MCP server đã viết ở Module 9. Ghi lại cấu hình máy của bạn và mức độ phù hợp với các mốc trong bảng cấu hình ở mục 1.

📚 Tài nguyên học tập

✅ Tự đánh giá hoàn thành

  • Xác định được cấu hình máy hiện tại của mình rơi vào mức nào trong bảng ở mục 1
  • Cài đặt thành công môi trường dev đầy đủ (Python/uv, Docker, VS Code)
  • Chạy thử được ít nhất 1 model local qua Ollama và đo được tốc độ sinh token thực tế
  • Biết tra cứu đúng bảng khi cần chọn công cụ cho một module cụ thể