What Is Statistic
Statistic คือศาสตร์ที่เป็นการศึกษาจากกลุ่มตัวอย่าง(Sample)เพื่อมาอธิบายโลกความจริง(Population)
Inductive reasoning is a specific observation to general conclusion”
Sampling
Sampling คือ การสุ่มตัวอย่างออกมาจากประชากรทั้งหมด โดย assume ว่าสามารถ represent ประชากรทั้งหมดได้
ยิ่ง Sample เข้าใกล้ Population เท่าไหร่ Result ยิ่ง Accuracy มากขึ้น แต่ Sampling ในการทำงานถูกจำกัดอยู่ 2 อย่าง คือ Budget and Time
Sampling’s Method
แบ่งออกเป็น Probability Sampling และ Non-probability Sampling
- Probability Sampling 🎲 (Efficient ที่สุด)
- Simple random sampling การสุ่มที่ต้องทำในระบบปิดคือที่ต้องมีรายชื่อประชากรทั้งหมดก่อน ทุกๆคนจะมีโอกาศถูกสุ่มได้เท่าๆกัน เช่น ล๊อตตารี่
- Systematic random sampling สุ่มแบบเป็นระบบเช่น สุ่ม1เว้น2 เป็นต้น คือเราต้องกำหนด Rule Base ในการเลือกกลุ่มตัวอย่าง

- Cluster random sampling แบ่ง Population ออกเป็น Cluster

- Stratified random sampling (ใช้ในงาน Market research) Step แบ่ง Population ออกเป็น Region (และใช้ random sampling ใน region นั้นๆอีกที) → Survey ตามพื้นที่ → สรุปผล
- Non-Probability Sampling
- Convenience ส่วนใหญ่ นักศึกษาใช้วิธีนี้ซึ่งไม่สามารถ Represent ประชากรทั้งหมดได้ เพราะ ข้อมูลจะอยู่กระจุกอยู่ที่ส่วนใดส่วนหนึ่งของทั้งหมด เช่น ออกแบบสอบถามใน google form ส่งให้เพื่อนช่วยทำ เป็นต้น
- Snowball Sampling เช่น สำรวจคนที่ซื้องาช้าง จะได้กลุ่มคนที่เหมือนๆกัน high bias แต่อย่างน้อยก็มีข้อมูล เช่นถามคนที่รู้จักกันแล้วเซอเวย์คนนี้ต่อๆเป็นทอดๆ

นักสถิติสมัยก่อนเวลาเก็บรวบรวมกลุ่มตัวอย่างขึ้นมาแต่ละรอบนั้นค่อนข้างลำบากเลยเกิดทฤษฎีที่มีชื่อว่า Central Limit Theorem ขึ้นมาเพื่อเป็นการบอกว่าถ้าเราทำการทดลองซ้ำไปเรื่อยๆและพล๊อตเป็นกราฟ ค่าเฉลี่ยที่ได้จะเข้าใกล้ค่าเฉลี่ยของประชากรหรือค่าเฉลี่ยที่แท้จริง(Mean Population) ทฤษฏีนี้เป็นแกนหลักของสถิติแบบ Frequentist

Central Limit theorem
Central Limit theorem (CLT)บอกว่าถ้าเกิดเราสุ่ม Sample ออกมาจาก Population หรือที่เรียกว่า Resampling ซ้ำหลายๆครั้งแล้วนำผลลัพท์ที่ได้จากการ Resampling มาพล๊อตเป็นกราฟ Sampling Distribution ที่ได้จะเป็น Normal Distribution ไม่ว่า Population นั้นๆจะมี Distribution แบบไหนก็ตาม

โดย Satisfy กฏอย่างน้อย 2 ข้อนี้
- Sample size >= 30 ขนาดกลุ่มตัวอย่างต้องมากกว่า30
- Random Sampling ต้องเป็นไปในแบบสุ่ม

Descriptive Statistic
1. Central Tendency
have only tree parameter to measure center of normal distribution curve center.
- Mean
- Median (A robust stat mean that outlier does not affect median)
- Mode
2. Measure Of Spread
Is used to know spread between x that how far from mean

- SD
- Variance
- Range (Max-Min)
- IQR

Boxplot มี 3 Quarter ซึ่งวัดจาก Percentile ของ Index of dataset
- Q1 คือ percentile ที่ 25
- Q2 คือ percentile ที่ 50 หรือ median
- Q3 คือ percentile ที่ 75
IQR คือ Q3-Q1
+-1.5 of IQR คือ outlier
3. Measure of Position
- Max
- Percentile
- Min
Inferential Statistics
เครื่องมือหลักใน Inferential Statistics
- Parameter Estimation: การใช้ข้อมูลจากตัวอย่างเพื่อประมาณค่าของพารามิเตอร์ที่สนใจของประชากร เช่น การประมาณค่าเฉลี่ยของรายได้ประชากรทั้งประเทศจากข้อมูลรายได้ของกลุ่มตัวอย่าง
- Point Estimate: การให้ค่าประมาณเป็นค่าเดียว เช่น ค่าเฉลี่ยของตัวอย่างถูกใช้เป็นค่าประมาณของค่าเฉลี่ยประชากร
- Confidence Interval: การให้ค่าประมาณเป็นช่วงของค่าที่มีโอกาสครอบคลุมค่าพารามิเตอร์ของประชากรด้วยระดับความเชื่อมั่นที่กำหนด เช่น “เรามีความเชื่อมั่น 95% ว่าค่าเฉลี่ยรายได้ของประชากรอยู่ในช่วง 25,000 – 30,000 บาท”
- Hypothesis Testing: การใช้ข้อมูลจากตัวอย่างเพื่อตัดสินใจว่ามีหลักฐานเพียงพอที่จะปฏิเสธสมมติฐานเกี่ยวกับประชากรหรือไม่ เช่น การทดสอบว่ายาใหม่มีประสิทธิภาพในการรักษาโรคดีกว่ายาเก่าหรือไม่
- สมมติฐานหลัก (Null Hypothesis)
- สมมติฐานทางเลือก (Alternative Hypothesis)

Leave a Reply