Databricks for Data & AI Engineers
Khoá học chi tiết về nền tảng Databricks — từ kiến trúc Lakehouse, Delta Lake, Spark, Unity Catalog đến vận hành pipeline production và xây dựng ứng dụng AI/RAG bằng Mosaic AI. Thiết kế nối tiếp cho người đã học AI Engineer Master Course, đào sâu phần Data Engineering vốn chỉ lướt qua ở khoá đó, và cho thấy cách triển khai RAG/Agent trên một nền tảng lakehouse thống nhất thay vì ghép nhiều dịch vụ rời rạc.
🚀 AI Engineer Master Course
Nên học trước — đặc biệt Module 4-11 (LLM, RAG, Agent) — để Module 10 (Databricks for AI/LLM) của khoá này dễ tiếp thu hơn. Xem khoá học →
🧬 Fine-tuning & Model Customization
Học sau — khi cần tự huấn luyện model thay vì chỉ gọi Foundation Model API, kết hợp tốt với hạ tầng GPU/MLflow đã học ở Module 9. Xem khoá học →
🐳 Docker for Backend & AI Engineers
Nền tảng bổ trợ — container hoá công cụ local (Module 2), tuỳ chỉnh Databricks Connect/CLI setup, và hiểu sâu hơn phần hạ tầng bên dưới Job cluster. Xem khoá học →
🗺️ 3 phần chính của khoá học
Module 1-5
Kiến trúc Lakehouse, compute, Delta Lake, Spark, và Unity Catalog — nền tảng bắt buộc trước khi xây pipeline thật.
Module 6-9, 11-13
Ingestion, orchestration, SQL warehousing, MLflow, tối ưu chi phí, bảo mật, và CI/CD — vận hành pipeline production.
Module 10, 14
Mosaic AI: Vector Search, Model Serving, RAG/Agent production — nối tiếp kiến thức AI Engineer trên nền tảng Databricks.
📘 14 Module học tập
Nhấp vào từng module để xem nội dung chi tiết, bài tập thực hành, và tài nguyên học tập.
🏛️ Tổng quan Lakehouse & Kiến trúc Databricks
Databricks là gì, kiến trúc Lakehouse giải quyết vấn đề gì, và các thành phần chính của nền tảng.
✓⚙️ Workspace, Compute & Cluster
Workspace UI, các loại compute (cluster/SQL warehouse/serverless), Databricks Runtime, Photon, cluster policy, CLI.
✓🗄️ Delta Lake Fundamentals
ACID transaction, transaction log, time travel, schema evolution, OPTIMIZE/Z-ORDER/VACUUM, Liquid Clustering, MERGE INTO.
✓⚡ Spark & PySpark trên Databricks
DataFrame API, Spark SQL, kiến trúc thực thi (partition/shuffle/Catalyst/AQE), Photon, tối ưu hiệu năng.
✓🔐 Unity Catalog — Data Governance
3-level namespace, metastore, access control, row/column-level security, data lineage, Volumes, system tables.
✓📥 Data Ingestion — Auto Loader & Lakeflow Declarative Pipelines
Auto Loader (cloudFiles), COPY INTO, Lakeflow Declarative Pipelines (trước đây là Delta Live Tables), data quality expectations.
✓🔗 Orchestration — Databricks Workflows & Jobs
Jobs UI, task dependencies, các loại task, retries/alerting, giới thiệu Databricks Asset Bundles.
✓📐 Databricks SQL & Data Warehousing
SQL Warehouses, dashboard, Genie (hỏi đáp ngôn ngữ tự nhiên), tích hợp công cụ BI, tối ưu truy vấn.
✓🧪 MLflow — Experiment Tracking & Model Registry
MLflow Tracking, MLflow Models, Model Registry trên Unity Catalog, vòng đời model từ thực nghiệm đến production.
✓🤖 Databricks for AI/LLM — Mosaic AI
Foundation Model APIs, Mosaic AI Model Serving, Mosaic AI Vector Search, AI Gateway, xây RAG/Agent production trên lakehouse.
✓💸 Performance Tuning & Cost Optimization
Cluster sizing, Photon cost/perf, serverless vs classic, spot instance, caching, theo dõi chi phí qua system tables.
✓🛡️ Security & Governance nâng cao
Network security (VPC/VNet injection, PrivateLink), secret management, ABAC, audit logs, compliance.
✓🔁 CI/CD với Databricks Asset Bundles
Cấu trúc bundle.yml chi tiết, targets nhiều môi trường, testing code Spark, quy trình promote dev→staging→production.
✓🏆 Dự án thực chiến & Lộ trình chứng chỉ
Capstone project end-to-end kết hợp toàn bộ khoá học, và tổng quan các chứng chỉ Databricks nên nhắm tới.
📖 Cách sử dụng khoá học này
Module 1-5 nên học tuần tự (mỗi module xây trên khái niệm module trước). Từ Module 6 trở đi có thể điều chỉnh thứ tự theo nhu cầu thực tế — ví dụ nếu công việc hiện tại thiên về BI, ưu tiên Module 8 sớm hơn; nếu thiên về AI/GenAI, có thể học Module 10 ngay sau Module 6-7. Tiến độ được lưu tự động trên trình duyệt này khi bạn nhấn "Đánh dấu đã hoàn thành" ở cuối mỗi trang.