Data Science Cheat Sheet
สรุปเนื้อหาสำคัญสำหรับ Data Science
Data Science Pipeline
กระบวนการพื้นฐานสำหรับการทำโปรเจกต์ Data Science ประกอบด้วยขั้นตอนต่อไปนี้
- Data Collection: การรวบรวมข้อมูลดิบจากแหล่งต่างๆ
- Data Preprocessing: การทำความสะอาดข้อมูล (Data Cleaning) จัดการ Missing Values และกำจัด Outliers
- Exploratory Data Analysis (EDA): การวิเคราะห์ข้อมูลเบื้องต้นเพื่อทำความเข้าใจลักษณะของข้อมูล
- Feature Engineering: การสร้างหรือแปลงตัวแปรเพื่อให้เหมาะสมกับการทำ Machine Learning
- Modeling: การฝึกสอนโมเดลด้วยอัลกอริทึมที่เหมาะสม
- Evaluation: การประเมินประสิทธิภาพของโมเดล
- Deployment: การนำโมเดลไปใช้งานจริงบนระบบ Production
Exploratory Data Analysis (EDA)
การทำ EDA เป็นขั้นตอนสำคัญในการค้นหา Insights และแพทเทิร์นในข้อมูล
- Descriptive Statistics: การใช้ค่าทางสถิติเช่น Mean, Median, Mode, Variance และ Standard Deviation
- Data Visualization: การสร้างกราฟเช่น Histograms, Scatter Plots, Box Plots และ Correlation Matrices เพื่อดูความสัมพันธ์ระหว่างตัวแปร
Feature Engineering
กระบวนการปรับปรุงฟีเจอร์เพื่อเพิ่มประสิทธิภาพของโมเดล
- Imputation: การเติมค่าที่หายไป (Missing Values) ด้วยค่า Mean, Median หรือวิธีอื่นๆ
- Encoding: การแปลง Categorical Data เป็น Numerical Data ผ่านเทคนิคเช่น One-Hot Encoding หรือ Label Encoding
- Scaling: การปรับสเกลข้อมูลเช่น Standardization (Z-score) และ Normalization (Min-Max Scaling)
- Feature Selection: การเลือกเฉพาะฟีเจอร์ที่มีความสำคัญต่อการทำนาย เพื่อลด Dimensionality