2  Các kỹ thuật thu thập dữ liệu

2.1 Thu thập dữ liệu sơ cấp (Primary Data)

Dữ liệu được thu thập trực tiếp từ nguồn ban đầu.

Khảo sát (Survey / Questionnaire)

  • Google Form, paper form

  • Thu thập ý kiến, hành vi, đặc điểm

  • Có thể là:

    • Câu hỏi đóng (multiple choice)
    • Câu hỏi mở
  • Ưu: dễ mở rộng, chi phí thấp

  • Nhược: bias, người trả lời không trung thực

Phỏng vấn (Interview)

  • 1-1 hoặc nhóm (focus group)

  • Có thể:

    • Structured (cố định)
    • Semi-structured
    • Unstructured
  • Ưu: sâu, hiểu ngữ cảnh

  • Nhược: tốn thời gian, khó scale

Quan sát (Observation)

  • Quan sát hành vi thực tế (offline hoặc online)

  • Ví dụ:

    • Theo dõi user dùng app
    • Ghi log hành vi
  • Ưu: ít bias hơn self-report

  • Nhược: khó đo biến ẩn (intention)

Thực nghiệm (Experiment)

  • Ví dụ: A/B testing, RCT
  • Có can thiệp vào biến X để xem ảnh hưởng lên Y
  • Ưu: mạnh về nhân quả (causal inference)
  • Nhược: tốn chi phí, cần thiết kế tốt

2.2 Thu thập dữ liệu thứ cấp (Secondary Data)

Dữ liệu có sẵn, thu thập lại để sử dụng.

Dataset công khai

  • Kaggle, UCI, dữ liệu của chính phủ
  • Ưu: nhanh, miễn phí
  • Nhược: không đúng bài toán 100%

Web scraping

  • Crawl dữ liệu từ website
  • Ví dụ:
    • Giá sản phẩm
    • Review người dùng
  • Nhược:
    • Vấn đề pháp lý
    • Dữ liệu không sạch

API

  • Lấy dữ liệu từ dịch vụ:

    • Google Maps API
    • Twitter API
  • Ưu: có cấu trúc tốt

  • Nhược: rate limit, cần key

2.3 Thu thập dữ liệu tự động (System-generated)

Log dữ liệu

  • Click, time-on-page, event tracking

Sensor / IoT

  • GPS, nhiệt độ, camera
  • Ưu: real-time, scale lớn
  • Nhược: noisy, cần xử lý nhiều

2.4 Thu thập dữ liệu tổng hợp (Synthetic Data)

  • Tạo dữ liệu bằng:

    • Mô phỏng (Simulation)
    • Mô hình sinh dữ liệu (Generative model)
  • Ưu:

    • Không lo bảo mật
    • Tăng dữ liệu cho ML
  • Nhược:

    • Có thể sai lệch so với phân phối thực

2.5 Nguồn lực cộng đồng (Crowdsourcing)

  • Thu thập từ cộng đồng
  • Ví dụ: Gán nhãn dữ liệu (Amazon Mechanical Turk)
  • Ưu: scale lớn
  • Nhược: chất lượng không đồng đều

2.6 Kết hợp nhiều nguồn

  • Kết hợp:

    • Khảo sát + log dữ liệu
    • API + web scraping
  • Đây là cách phổ biến trong thực tế ML

2.7 Tóm tắt

Nhóm Phương pháp Khi nên dùng
Primary Survey, Interview, Experiment Khi cần dữ liệu đúng mục tiêu
Secondary Dataset, API, scraping Khi cần nhanh
System Logs, sensors Khi làm web/app
Synthetic Simulation, GAN Khi thiếu dữ liệu
Crowd Labeling Khi cần gán nhãn