Tổng hợp toàn bộ tool/thư viện dùng xuyên suốt khoá học kèm link tài liệu, ghi chú hiệu năng, và cấu hình máy đề xuất — dùng làm trang tra cứu nhanh.
ToolsHạ tầngCấu hình máy
📌 Vì sao module này quan trọng
Chương này không dạy khái niệm mới — nó là bảng tra cứu tổng hợp mọi công cụ/thư viện
đã xuất hiện xuyên suốt 16 module, kèm link tài liệu chính thức và ghi chú thực tế về hiệu năng/cấu hình máy.
Quay lại đây bất cứ khi nào cần chọn công cụ cho một bài toán cụ thể, hoặc cần biết máy của bạn có đủ mạnh để
chạy một phần việc nào đó (đặc biệt là chạy model AI cục bộ) hay không.
🎯 Mục tiêu học tập
Biết cấu hình máy tối thiểu/khuyến nghị cho từng loại công việc trong khoá học
Có một bảng tra cứu nhanh công cụ/thư viện theo từng nhóm chức năng, không cần nhớ thuộc lòng
Hiểu khi nào nên gọi API cloud, khi nào nên tự host model cục bộ, và cấu hình phần cứng cần thiết cho từng lựa chọn
1. Cấu hình máy tổng quan cho khoá học
Tin tốt: hơn 90% nội dung khoá học (Module 1-6, 9-16) chỉ cần gọi API cloud — không đòi
hỏi GPU hay máy mạnh, vì toàn bộ việc "nặng" (chạy model) diễn ra trên server của nhà cung cấp. Chỉ khi bạn
chủ động chọn tự host model/embedding cục bộ (một phần tuỳ chọn của Module 4, 7, 17) mới cần cấu hình mạnh
hơn.
Nhu cầu
CPU
RAM
Ổ đĩa
GPU
Baseline — gọi API cloud, RAG/Agent qua FastAPI, Docker, pgvector nhỏ (<1 triệu vector)
4 nhân trở lên
16GB
SSD 256GB+
Không cần
Data Engineering — chạy Airflow + Spark local (Module 12) để học, không phải cluster thật
8 nhân trở lên
32GB
SSD 512GB+
Không cần
Local LLM nhỏ — chạy thử model 7B-8B quantized (Ollama) để học self-host
8 nhân trở lên
16GB
SSD 512GB (model chiếm 4-8GB/model)
Không bắt buộc (chạy CPU được, chậm hơn); có GPU 8GB+ VRAM thì nhanh hơn nhiều
Local LLM lớn / fine-tuning nhẹ — model 30-70B quantized, hoặc fine-tune LoRA model nhỏ
12 nhân trở lên
64GB+
SSD 1TB+ NVMe
GPU 24GB+ VRAM (vd. RTX 4090) hoặc thuê cloud GPU
💡 Khuyến nghị thực tế
Nếu máy hiện tại của bạn chỉ
đạt mức Baseline, đừng vội mua GPU — 95% công việc AI Engineer ứng dụng thực tế (kể cả đi
làm) dùng API cloud. Chỉ đầu tư GPU/máy mạnh khi bạn xác định rõ nhu cầu học sâu về self-hosting hoặc
fine-tuning. Khi cần thử nghiệm với model lớn, thuê GPU cloud theo giờ (RunPod, Lambda Labs, Google Colab)
luôn rẻ hơn mua máy trong giai đoạn học.
10. Chạy LLM cục bộ — cấu hình máy chi tiết theo kích thước model
Phần quan trọng nhất nếu bạn muốn tự host model (bảo mật dữ liệu, học sâu về inference, hoặc giảm chi
phí dài hạn cho khối lượng cực lớn). Nguyên tắc ước lượng nhanh: model quantize 4-bit (phổ biến nhất) cần
VRAM/RAM xấp xỉ (số tỷ tham số) × 0.6-0.7 GB.
Kích thước model
VRAM GPU cần (4-bit)
RAM CPU-only (chậm hơn 5-20 lần)
Ví dụ model
7B – 9B
6-8GB
16GB
Llama 3.1 8B, Qwen 2.5 7B
13B – 14B
10-12GB
24GB
Qwen 2.5 14B
30B – 34B
20-24GB
48GB
Qwen 2.5 32B, DeepSeek-Coder
70B
40-48GB (hoặc 2× GPU 24GB)
96GB+ (rất chậm)
Llama 3.1/3.3 70B
100B+ (MoE)
Thường cần multi-GPU chuyên dụng hoặc dùng qua API cloud
Phục vụ model ở quy mô production/throughput cao (nhiều request đồng thời), cần GPU thật, không phù hợp laptop cá nhân
⚠️ Đừng nhầm lẫn mục tiêu
Chạy local LLM để học
cách hoạt động (Module 4) khác với chạy local LLM để thay thế API cloud trong production
(Module 10, 13). Với production, chỉ tự host khi có lý do rõ ràng (bảo mật dữ liệu bắt buộc, chi phí ở quy
mô cực lớn đã tính toán kỹ) — vận hành GPU cluster đáng tin cậy phức tạp hơn nhiều so với gọi API.
CI/CD phổ biến nhất để chạy regression eval tự động (Module 11, 13)
🏋️ Bài tập thực hành
Thiết lập môi trường phát triển đầy đủ
Cài đặt trên máy của bạn: Python 3.11+ qua uv, Docker Desktop, VS Code + Claude Code. Chạy thử
Ollama với 1 model 7-8B (ví dụ Llama 3.1 8B) để tự đo tốc độ sinh token trên máy bạn (CPU-only so với có GPU
nếu có). Cài MCP Inspector qua npx và thử kết nối với MCP server đã viết ở Module 9. Ghi lại cấu hình máy
của bạn và mức độ phù hợp với các mốc trong bảng cấu hình ở mục 1.