ASYMMETRIC GRID ARCHITECTURE
DATA INFRASTRUCTURE
FOR THE MODERN
ENTERPRISE
คู่มือแนวทางการศึกษา Data Engineering แบบครบวงจร อ้างอิงเนื้อหาหลักตามมาตรฐานสากล พร้อมแล็บทดลองปฏิบัติจริงและเทคนิคการประหยัดค่าใช้จ่ายบนระบบ Production — Orchestrate, manage, and scale complex data pipelines with elegant architectural simplicity. Built on First Principles, Compute Cost Efficiency, and 5-Layer Data Quality Observability.
Production-safe Write-Audit-Publish data contracts with 5-layer automated quality assertions.
แบบประเมินทักษะวิศวกรรมข้อมูลเชิงระบบ
ทดสอบระดับความรู้รากฐาน ทฤษฎีเชิงสถาปัตยกรรม และวิศวกรรมการประมวลผลข้อมูล เพื่อรับคำแนะนำบทเรียนเริ่มต้นที่ตอบโจทย์ระดับทักษะคุณมากที่สุด
Question goes here?
รากฐานวิศวกรรมซอฟต์แวร์และระบบ (Foundations of Software & Systems)
เครื่องมือและทักษะการพัฒนาซอฟต์แวร์พื้นฐานหลักที่วิศวกรข้อมูลทุกคนจำเป็นต้องเชี่ยวชาญ
ข้อมูลเบื้องต้นเกี่ยวกับวิศวกรรมข้อมูล (Introduction to Data Engineering)
ทำความเข้าใจบทบาทหน้าที่ของ Data Engineer และวงจรชีวิตข้อมูล (Data Life Cycle)
Python สำหรับ Data Engineering
การใช้งาน Python และ Pandas สำหรับประมวลผลข้อมูลดิบอย่างมีประสิทธิภาพ
พื้นฐาน Linux & CLI สำหรับวิศวกรข้อมูล
คำสั่งคอมมานด์ไลน์ การวิเคราะห์ข้อความ และการรัน Bash Script อัตโนมัติ
Git สำหรับระบบงานข้อมูลและทีมพัฒนา
ควบคุมเวอร์ชันของ Code ข้อมูลด้วย Git เรียนรู้การทำงานร่วมกันผ่านกิ่ง (Branch) และการแก้ข้อขัดแย้ง (Merge Conflict)
พื้นฐานเครือข่าย เว็บเทคโนโลยี และระบบกระจายศูนย์ (Web Fundamentals, Networking & Distributed Systems)
เจาะลึกกระบวนการทำงานของ Web, IP/DNS, TCP vs UDP, Ports, HTTP Verbs/Status Codes, Security (TLS/CORS), State Management (Cookie/JWT) และ CAP Theorem
การจัดเก็บและสร้างแบบจำลองข้อมูล (Data Storage & Modeling)
ทฤษฎีฐานข้อมูลเชิงสัมพันธ์ ขั้นสูง และแนวคิดการวางโครงสร้างจัดเก็บตารางแบบมิติเพื่อการวิเคราะห์ธุรกิจ
SQL ขั้นสูง (Window Functions & Optimization)
เจาะลึกคำสั่งคิวรีขั้นสูง การทำ Window Functions และการเพิ่มสปีดการเข้าถึงตาราง
ฐานข้อมูลไม่ใช่เชิงสัมพันธ์ (NoSQL Databases & Modern Stores)
เรียนรู้สถาปัตยกรรมฐานข้อมูลประเภท Document, Columnar, Graph, Key-Value และแนวคิดทฤษฎี CAP
การออกแบบโครงสร้างข้อมูล (Star/Snowflake & SCD)
ออกแบบโมเดลข้อมูลเพื่อการวิเคราะห์ทางธุรกิจที่รวดเร็วด้วยโครงสร้างตารางยอดขาย/มิติ และจัดการประวัติการเปลี่ยนข้อมูลด้วย SCD
โครงสร้างพื้นฐานเครือข่ายระบบคลาวด์ (Cloud-based Networking)
เรียนรู้ระบบเน็ตเวิร์กบนคลาวด์ VPC, Load Balancer, VPN และบริการประมวลผลพื้นฐาน
คลังข้อมูลคลาวด์และสถาปัตยกรรมยุคใหม่ (Modern Warehouse & Lakehouse)
ระบบจัดเก็บข้อมูลแบบ Open Table format สถาปัตยกรรม Lakehouse และแนวคิดการประมวลผลข้อมูลในเครื่องที่รวดเร็ว
สถาปัตยกรรม Data Lakehouse (Apache Iceberg & MinIO)
สร้างสถาปัตยกรรมการจัดเก็บข้อมูลสมัยใหม่ที่มีประสิทธิภาพสูงด้วย Apache Iceberg ร่วมกับ MinIO Object Storage
Local-first Data Engineering ด้วย DuckDB
ใช้พลังของ DuckDB ประมวลผลข้อมูลกิกะไบต์ในเครื่องของตนเองรวดเร็วกว่าระบบคลาวด์ขนาดใหญ่
โครงสร้างพื้นฐานในรูปแบบโค้ด (IaC ด้วย Terraform)
เตรียมทรัพยากรจัดเก็บข้อมูล (Cloud Storage Bucket) และเครื่องประมวลผลข้อมูลผ่านโค้ดโครงสร้างพื้นฐาน (IaC)
การนำเข้าและการแปลงรูปข้อมูล (Data Ingestion & Transformation)
การแปลงข้อมูลดิบให้เป็นข้อมูลวิเคราะห์ที่มีประโยชน์อย่างเป็นระบบ พร้อมการกำหนดสัญญาความปลอดภัยของข้อมูล
การแปลงข้อมูลระดับโปรด้วย dbt-core
ทำความเข้าใจการเขียน SQL ในรูปแบบ Modular การสร้างเอกสารอัตโนมัติ และการเขียน Data Quality Tests ด้วย dbt
ข้อตกลงร่วมด้านข้อมูล (Data Contracts)
ควบคุมคุณภาพและโครงสร้างข้อมูลต้นทางระหว่างทีมซอฟต์แวร์และทีมข้อมูลเพื่อป้องกันระบบปลายทางพังเนื่องจากหน้าตาข้อมูลเปลี่ยน
การบริการและการส่งต่อข้อมูลวิเคราะห์ (Data Serving & Reverse ETL)
การเปิดระบบส่งออกข้อมูลวิเคราะห์เข้าสู่เครื่องมือธุรกิจ BI (PowerBI/Looker) และระบบ CRM ผ่านกระบวนการ Reverse ETL
ระบบประมวลผลขนาดใหญ่และการจัดลำดับงาน (Orchestration, Scale & Streaming)
การจัดการท่อข้อมูลแบบเรียลไทม์ การควบคุมเวิร์กโฟลว์ด้วย DAG และเครื่องมือประมวลผลบนระบบกระจายศูนย์ (Big Data)
การประมวลผลข้อมูลขนาดใหญ่แบบกระจายด้วย Apache Spark
ทำความเข้าใจการประมวลผลข้อมูลระดับ Terabytes ด้วย Spark Architecture และการเขียน PySpark เพื่อดึงประสิทธิภาพสูงสุด
ระบบจัดการเวิร์กโฟลว์ข้อมูล (Airflow, Dagster & Prefect)
เปรียบเทียบและใช้งานระบบจัดระเบียบงานส่งข้อมูล (Orchestration) เพื่อสร้างท่อข้อมูลที่ไม่สะดุดและรองรับการรันซ้ำเมื่อพัง
การประมวลผลข้อมูลแบบเรียลไทม์ด้วย Kafka & Redpanda
ออกแบบระบบส่งรับข้อความแบบ Pub/Sub สำหรับงานข้อมูลแบบเรียลไทม์
การจัดการคอนเทนเนอร์และคลัสเตอร์ (Containers & Kubernetes)
ทำความเข้าใจการรันโปรแกรมข้อมูลในตู้ Docker และการดูแลคลัสเตอร์ขนาดยักษ์ด้วย Kubernetes (GKE/EKS)
ระบบ CI/CD และการเฝ้าระวังคุณภาพข้อมูล (CI/CD, Monitoring & Testing)
การรันชุดทดสอบท่อข้อมูลอัตโนมัติผ่าน GitHub Actions และมอนิเตอร์สถานะเซิร์ฟเวอร์ด้วย Prometheus & Grafana
ระบบความปลอดภัยและการควบคุมข้อมูล (Security, Governance & Privacy)
การทำข้อมูลหน้ากาก (Data Masking) สิทธิ์การเข้าถึงข้อมูลตามมาตรฐาน GDPR และการติดตามแผนผังความสัมพันธ์ข้อมูล (Data Lineage)
ระบบปฏิบัติการและประมวลผลโมเดล (Machine Learning & MLOps)
ทำความเข้าใจการเชื่อมโยงท่อข้อมูลประมวลผลเข้ากับโมเดลการเรียนรู้ของเครื่อง (Machine Learning) และแนวคิดวงจรชีวิต MLOps
สถาปัตยกรรมเครือข่าย AWS VPC (AWS VPC Architecture)
เจาะลึกระบบเครือข่ายบนคลาวด์ การออกแบบซับเน็ต การจัดทำเราติ้ง และการเชื่อมต่อข้ามเครือข่ายระดับองค์กร
รากฐานของ AWS VPC
เข้าใจโครงสร้างพื้นฐานของ VPC, Subnets, Route Tables และ Internet Gateway
การจัดการเส้นทางขั้นสูงและ NAT Gateway
การจัดการทราฟฟิกออกสู่ภายนอกสำหรับ Private Subnets
การเชื่อมต่อหลาย VPC และ Hybrid Cloud
การใช้งาน VPC Peering และ Transit Gateway
VPC Endpoints (PrivateLink)
การเชื่อมต่อบริการ AWS โดยไม่ผ่านอินเทอร์เน็ตสาธารณะ
ระบบรักษาความปลอดภัยขอบเขตเครือข่าย
NACL, Security Groups และ Network Firewall
สถาปัตยกรรมเครือข่ายสำหรับ EKS
VPC CNI และการจัดสรร IP สำหรับ Kubernetes
IPv6 และการจัดการ IP Address
การประยุกต์ใช้ IPv6 และ AWS IPAM
สถาปัตยกรรมเครือข่ายระดับโลก
CloudFront, Global Accelerator และ Route53
สถาปัตยกรรม Kubernetes (Kubernetes Architecture)
เจาะลึกระบบบริหารจัดการคอนเทนเนอร์ระดับองค์กร กลไกการทำงานภายใน และการตั้งค่าสำหรับระบบโปรดักชัน
แก่นแท้ของสถาปัตยกรรม Kubernetes
หลักการทำงานของ Declarative State
สถาปัตยกรรมเครื่องและคอมโพเนนต์
เจาะลึก Control Plane และ Worker Nodes
เลเยอร์ที่เชื่อมต่อได้ (Pluggable Layers)
การทำงานของ CNI, CSI และ CRI
การรันบนโปรดักชันระดับองค์กร
ข้อควรพิจารณาและแนวทางปฏิบัติสำหรับระดับองค์กร
สถาปัตยกรรมประมวลผลสตรีมมิ่งเรียลไทม์ขั้นสูง (Real-Time Streaming Engine)
เจาะลึกกลไก Flink Stateful Processing, CDC Event Sourcing และการ Join ข้อมูลสตรีมมิ่งความเร็วสูงระดับล่าง
Apache Flink Stateful Stream Processing
กลไก State Backends, RocksDB Checkpointing, Event Time, Watermarking และ CEP
Real-Time CDC & Event Sourcing at Scale
สถาปัตยกรรม Debezium, Transactional Outbox Pattern และ Kafka Connect
Low-Latency Stream-Table Joins & Windowing
การทำ Tumbling, Sliding, Session Windows และ Temporal Table Joins
วิศวกรรมความน่าเชื่อถือและการเฝ้าระวังข้อมูล (Data Quality & Reliability)
สถาปัตยกรรม Data Lineage Graph, การตรวจจับ Data Drift ทางสถิติ และระบบอัตโนมัติแก้ไข Data Incidents
Data Lineage & Metadata Graph Engineering
มาตรฐาน OpenLineage, Apache Atlas และ Graph Queries วิเคราะห์ Blast Radius
Statistical Anomaly Detection & Data Drift
การใช้อัลกอริทึมทางสถิติ Z-Score, Isolation Forest และ KS-Test ตรวจจับ Data Drift
Data Incident Management & Automated DLQ Remediation
สถาปัตยกรรม Circuit Breaker, DLQ Quarantine และระบบกู้คืนข้อมูลอัตโนมัติ
การบริหารทรัพยากร สถาปัตยกรรม Data Mesh และโครงสร้าง AI Vector (FinOps & Platform)
การควบคุม Compute Cost คลาวด์, สถาปัตยกรรม Data Mesh ระดับองค์กร และโครงสร้าง Vector DB สำหรับ AI Pipelines
Cloud Data FinOps & Cost Optimization Mechanics
การวิเคราะห์ Cost/Query, Spot Instance Orchestration และการลดค่า Egress
Data Mesh & Multi-Tenant Platform Architecture
การสร้าง Data Products, Federated Governance และ Self-serve Data Platform
Vector Databases & AI-Ready Data Infrastructure
สถาปัตยกรรม pgvector, Milvus, Qdrant, RAG Data Ingestion และ HNSW/IVF Indexing
วิศวกรรมสถาปัตยกรรม API ระดับองค์กร (Enterprise API Engineering & Architecture)
เจาะลึกประเภท API, สถาปัตยกรรม REST/SOAP/GraphQL/gRPC, Idempotency, Rate Limiting, OWASP Security และ World-Class Caching
API Fundamentals, Architectures & Core Components
ประเภท API (Public/Private/Partner/Composite), REST vs SOAP vs GraphQL vs gRPC, Core Components และ OAuth 2.0
API Versioning, Docs, Real-Time & Microservices
URL/Header Versioning, Swagger OpenAPI, Webhooks vs WebSockets และ API Gateway Architecture
Production Reliability, Security & Resiliency
Idempotency Keys, Pagination/Filtering, OWASP API Top 10 (BOLA/Mass Assignment), Circuit Breaker และ Pact Contract Testing
World-Class Master Architecture & Traffic Management
Paradigms Selection, Advanced Caching (SWR/Write-Behind), Rate Limiting Algorithms (Token/Leaky Bucket), Zero Trust mTLS, CQRS และ Graceful Deprecation
Data Pipeline Architecture & WAP Pattern
This module demonstrates the Write-Audit-Publish (WAP) Pattern. Raw data is ingested into a temporary staging layer, subjected to 100% Data Quality audit checks, and safely published to Gold tables only upon verification.