Data Analytics | Insights & Research

PUAY101

ไอเดียที่ได้จาก Sprint: Statistic

What Is Statistic

Statistic คือศาสตร์ที่เป็นการศึกษาจากกลุ่มตัวอย่าง(Sample)เพื่อมาอธิบายโลกความจริง(Population)

Inductive reasoning is a specific observation to general conclusion”


Sampling

Sampling คือ การสุ่มตัวอย่างออกมาจากประชากรทั้งหมด โดย assume ว่าสามารถ represent ประชากรทั้งหมดได้

ยิ่ง Sample เข้าใกล้ Population เท่าไหร่ Result ยิ่ง Accuracy มากขึ้น แต่ Sampling ในการทำงานถูกจำกัดอยู่ 2 อย่าง คือ Budget and Time

Sampling’s Method

แบ่งออกเป็น Probability Sampling และ Non-probability Sampling

  1. Probability Sampling 🎲 (Efficient ที่สุด)
    • Simple random sampling การสุ่มที่ต้องทำในระบบปิดคือที่ต้องมีรายชื่อประชากรทั้งหมดก่อน ทุกๆคนจะมีโอกาศถูกสุ่มได้เท่าๆกัน เช่น ล๊อตตารี่
    • Systematic random sampling สุ่มแบบเป็นระบบเช่น สุ่ม1เว้น2 เป็นต้น คือเราต้องกำหนด Rule Base ในการเลือกกลุ่มตัวอย่าง
    • Cluster random sampling แบ่ง Population ออกเป็น Cluster
    • Stratified random sampling (ใช้ในงาน Market research) Step แบ่ง Population ออกเป็น Region (และใช้ random sampling ใน region นั้นๆอีกที) → Survey ตามพื้นที่ → สรุปผล
  2. Non-Probability Sampling
    • Convenience ส่วนใหญ่ นักศึกษาใช้วิธีนี้ซึ่งไม่สามารถ Represent ประชากรทั้งหมดได้ เพราะ ข้อมูลจะอยู่กระจุกอยู่ที่ส่วนใดส่วนหนึ่งของทั้งหมด เช่น ออกแบบสอบถามใน google form ส่งให้เพื่อนช่วยทำ เป็นต้น
    • Snowball Sampling เช่น สำรวจคนที่ซื้องาช้าง จะได้กลุ่มคนที่เหมือนๆกัน high bias แต่อย่างน้อยก็มีข้อมูล เช่นถามคนที่รู้จักกันแล้วเซอเวย์คนนี้ต่อๆเป็นทอดๆ

นักสถิติสมัยก่อนเวลาเก็บรวบรวมกลุ่มตัวอย่างขึ้นมาแต่ละรอบนั้นค่อนข้างลำบากเลยเกิดทฤษฎีที่มีชื่อว่า Central Limit Theorem ขึ้นมาเพื่อเป็นการบอกว่าถ้าเราทำการทดลองซ้ำไปเรื่อยๆและพล๊อตเป็นกราฟ ค่าเฉลี่ยที่ได้จะเข้าใกล้ค่าเฉลี่ยของประชากรหรือค่าเฉลี่ยที่แท้จริง(Mean Population) ทฤษฏีนี้เป็นแกนหลักของสถิติแบบ Frequentist

Central Limit theorem

Central Limit theorem (CLT)บอกว่าถ้าเกิดเราสุ่ม Sample ออกมาจาก Population หรือที่เรียกว่า Resampling ซ้ำหลายๆครั้งแล้วนำผลลัพท์ที่ได้จากการ Resampling มาพล๊อตเป็นกราฟ Sampling Distribution ที่ได้จะเป็น Normal Distribution ไม่ว่า Population นั้นๆจะมี Distribution แบบไหนก็ตาม

โดย Satisfy กฏอย่างน้อย 2 ข้อนี้

  1. Sample size >= 30 ขนาดกลุ่มตัวอย่างต้องมากกว่า30
  2. Random Sampling ต้องเป็นไปในแบบสุ่ม

Descriptive Statistic

1. Central Tendency

have only tree parameter to measure center of normal distribution curve center.

  • Mean
  • Median (A robust stat mean that outlier does not affect median)
  • Mode

2. Measure Of Spread

Is used to know spread between x that how far from mean

  • SD
  • Variance
  • Range (Max-Min)
  • IQR

Boxplot มี 3 Quarter ซึ่งวัดจาก Percentile ของ Index of dataset

  • Q1 คือ percentile ที่ 25
  • Q2 คือ percentile ที่ 50 หรือ median
  • Q3 คือ percentile ที่ 75

IQR คือ Q3-Q1

+-1.5 of IQR คือ outlier

3. Measure of Position

  • Max
  • Percentile
  • Min

Inferential Statistics

เครื่องมือหลักใน Inferential Statistics

  • Parameter Estimation: การใช้ข้อมูลจากตัวอย่างเพื่อประมาณค่าของพารามิเตอร์ที่สนใจของประชากร เช่น การประมาณค่าเฉลี่ยของรายได้ประชากรทั้งประเทศจากข้อมูลรายได้ของกลุ่มตัวอย่าง
    • Point Estimate: การให้ค่าประมาณเป็นค่าเดียว เช่น ค่าเฉลี่ยของตัวอย่างถูกใช้เป็นค่าประมาณของค่าเฉลี่ยประชากร
    • Confidence Interval: การให้ค่าประมาณเป็นช่วงของค่าที่มีโอกาสครอบคลุมค่าพารามิเตอร์ของประชากรด้วยระดับความเชื่อมั่นที่กำหนด เช่น “เรามีความเชื่อมั่น 95% ว่าค่าเฉลี่ยรายได้ของประชากรอยู่ในช่วง 25,000 – 30,000 บาท”
  • Hypothesis Testing: การใช้ข้อมูลจากตัวอย่างเพื่อตัดสินใจว่ามีหลักฐานเพียงพอที่จะปฏิเสธสมมติฐานเกี่ยวกับประชากรหรือไม่ เช่น การทดสอบว่ายาใหม่มีประสิทธิภาพในการรักษาโรคดีกว่ายาเก่าหรือไม่
    • สมมติฐานหลัก (Null Hypothesis)
    • สมมติฐานทางเลือก (Alternative Hypothesis)

Reference

Comments

Leave a Reply

Discover more from PUAY101

Subscribe now to keep reading and get access to the full archive.

Continue reading