Chặng 1: Nghịch lý của thước đo sai lệch thô
Khảo sát thị phần $3$ thương hiệu $A, B, C$. Gọi số khách thực tế chọn từng hãng là $f_1, f_2, f_3$ và số khách lý thuyết kỳ vọng là $e_1, e_2, e_3$, với tổng mẫu quan sát $n = \sum f_i = \sum e_i$.
Để kiểm tra xem thực tế có phù hợp với kỳ vọng không, nếu ta chỉ cộng dồn trực tiếp các độ lệch $\sum (f_i - e_i)$ thì điều gì chắc chắn xảy ra?
Tổng sai lệch luôn luôn bằng $0$, vì phần dư thừa ở nhóm này triệt tiêu chính xác phần thiếu hụt ở nhóm khác.
Hãy nhớ lại: Tổng số quan sát $\sum f_i = n$ và tổng số kỳ vọng $\sum e_i = n$. Khi trừ hai vế, kết quả sẽ là gì?
Tổng sai lệch sẽ tăng lũy tiến theo cỡ mẫu $n$, làm sai số bị phóng đại vô hạn.
Trong các giá trị $(f_i - e_i)$, sẽ có nhóm dương và nhóm âm. Chúng có bù trừ cho nhau không?
Tổng sai lệch luôn mang giá trị dương vì thực tế luôn biến động ngẫu nhiên lớn hơn kỳ vọng.
Nếu một nhãn hàng thực tế có 40 người mua nhưng kỳ vọng là 60 người, thì $(f - e) = 40 - 60 = -20$. Đại lượng này hoàn toàn có thể âm!
Tổng sai lệch chỉ bằng $0$ khi dữ liệu mẫu trùng khớp hoàn hảo với giả thuyết ban đầu.
Dù dữ liệu thực tế có lệch rất lớn so với kỳ vọng, tổng $\sum f_i$ vẫn luôn đúng bằng $n$. Thử cộng $(-12) + (-2) + (+14)$ xem nào!
Vì $\sum (f_i - e_i) = \sum f_i - \sum e_i = n - n = 0$, độ lệch thô luôn bị triệt tiêu! Để đo lường khoảng cách sai lệch thực sự, ngành thống kê bắt buộc phải bình phương các sai lệch thành $(f_i - e_i)^2$ để triệt tiêu dấu âm trước khi cộng lại.
Chặng 2: Tại sao phải chia cho tần số kỳ vọng $e_i$?
Sau khi bình phương để triệt tiêu dấu âm, công thức kiểm định Chi-bình phương tiếp tục chia đại lượng này cho $e_i$:
$$\chi^2 = \sum \frac{(f_i - e_i)^2}{e_i}$$
Mục đích toán học và trực giác đằng sau việc chia cho $e_i$ ở mẫu số là gì?
Để chuẩn hóa độ lệch theo quy mô; một sai lệch $10$ đơn vị ở nhóm nhỏ quan trọng hơn nhiều so với ở nhóm rất lớn.
Hãy so sánh: Dự báo bán được 20 chiếc xe mà hụt 10 chiếc (lệch 50%), so với dự báo bán 1.000 chiếc mà hụt 10 chiếc (lệch 1%) thì cái nào nghiêm trọng hơn?
Để biến đổi chỉ số kiểm định thành một xác suất luôn nằm trong đoạn từ $0$ đến $1$.
Giá trị $\chi^2$ tính ra có thể bằng $7.34$, $15.8$ hay hàng trăm, không bị giới hạn trong khoảng $[0; 1]$.
Để chuyển đổi số đếm quan sát thành đơn vị tiền tệ hoặc tỷ lệ phần trăm tiêu chuẩn.
Cả tử số và mẫu số đều là tần số đếm, phép chia này để tỷ lệ hóa mức độ phân tán chứ không đổi đơn vị bên ngoài.
Để đảm bảo phân phối kết quả luôn có dạng đối xứng hình chuông chuẩn.
Phân phối Chi-bình phương là phân phối lệch phải (skewed right), không đối xứng như phân phối chuẩn.
Chia cho $e_i$ là phép chuẩn hóa tỷ lệ. Nếu $e_1 = 20$ mà lệch $10$, đó là biến động $50\%$. Nhưng nếu $e_2 = 1.000$ mà lệch $10$, đó chỉ là rung lắc $1\%$. Số hạng $\frac{(f_i - e_i)^2}{e_i}$ đo lường mức độ bất thường tương đối của dữ liệu.
Chặng 3: Bí ẩn của miền bác bỏ một phía (Upper-tail Test)
Dù giả thuyết $H_a$ trong kiểm định Chi-bình phương phát biểu ở dạng hai chiều (tổng thể không tuân theo quy luật, hoặc hai biến không độc lập), nhưng sách giáo khoa luôn khẳng định: **Kiểm định Chi-bình phương luôn là kiểm định một phía bên phải**.
Nguyên nhân toán học nào khiến vùng bác bỏ $H_0$ luôn nằm ở phần đuôi trên (bên phải) của đồ thị?
Vì sai lệch $(f - e)$ dù âm hay dương khi bị bình phương đều trở thành số dương lớn, đẩy giá trị $\chi^2$ về phía cực dương bên phải.
Nhìn vào tử số $(f - e)^2$: khi dữ liệu thực tế càng mâu thuẫn nặng nề với giả thuyết $H_0$, giá trị của $(f - e)^2$ sẽ tăng vọt về phía nào trên trục số?
Vì bảng phân phối Chi-bình phương trong các phụ lục chỉ in giá trị ở đuôi phải để tiết kiệm diện tích giấy in.
Bản chất nằm ở công thức đại số của thống kê kiểm định, không phải do cách trình bày sách in.
Vì quy ước quốc tế cấm thực hiện kiểm định hai phía trên các biến phân loại.
Không có quy ước cấm đoán cảm tính như vậy; dạng miền bác bỏ hoàn toàn do hành vi của đại lượng thống kê quy định.
Vì nếu kiểm định ở đuôi bên trái thì giá trị $p\text{-value}$ sẽ luôn vượt quá $1.0$.
Xác suất diện tích dưới đường cong không bao giờ vượt quá 1.0. Đuôi trái $\chi^2 \approx 0$ tương ứng với thực tế khớp hoàn hảo với kỳ vọng!
Khi thực tế khớp hoàn hảo với kỳ vọng ($f_i = e_i$), ta có $\chi^2 = 0$. Thực tế càng sai lệch xa kỳ vọng, tử số $(f_i - e_i)^2$ càng lớn, đẩy giá trị $\chi^2$ càng xa về phía dương vô cùng (đuôi phải). Do đó, bằng chứng chống lại $H_0$ luôn nằm ở đuôi bên phải: Bác bỏ $H_0$ khi $\chi^2 \ge \chi^2_\alpha$ (hoặc $p\text{-value} \le \alpha$).
Chặng 4: Logic Xác suất trong Bảng tiếp biến ($r \times c$)
Khảo sát $150$ người uống bia ($80$ Nam, $70$ Nữ). Tổng cộng có $70$ người thích bia thường. Để kiểm định tính độc lập giữa giới tính và sở thích, công thức tần số kỳ vọng cho ô Nam thích bia thường là:
$$e_{12} = \frac{(\text{Tổng hàng 1}) \times (\text{Tổng cột 2})}{n} = \frac{80 \times 70}{150} \approx 37.33$$
Công thức nhân chéo này được chứng minh dựa trên định lý xác suất nền tảng nào?
Nếu độc lập, xác suất tích bằng tích xác suất: $P(Nam \cap Bia\ thường) = P(Nam) \times P(Bia\ thường)$, nhân với cỡ mẫu $n$ sẽ ra đúng công thức trên.
Xác suất là Nam: $80/150$. Xác suất thích bia thường: $70/150$. Nếu độc lập, xác suất vừa là Nam vừa thích bia thường là gì? Hãy nhân với 150 để tìm số lượng kỳ vọng!
Giả định rằng tỷ lệ nam và nữ trong mẫu nghiên cứu bắt buộc phải bằng nhau ($50\% - 50\%$).
Mẫu có 80 Nam và 70 Nữ (không bằng nhau). Tính độc lập không đòi hỏi cỡ mẫu của hai giới phải ngang nhau.
Giả định rằng thị hiếu tiêu dùng tự động chia đều $33.3\%$ cho cả 3 loại bia có mặt trên thị trường.
Có 70/150 người thích bia thường (~46.7%), nghĩa là thị phần các loại bia không hề bằng nhau.
Tần số quan sát thực tế ở mỗi ô bắt buộc phải bằng trung bình nhân của tổng hàng và tổng cột.
Đây là tích số chia cho cỡ mẫu $n$, không phải là phép tính căn bậc hai của trung bình nhân.
Độc lập có nghĩa là $P(A \cap B) = P(A) \times P(B)$. Khi đó số lượng kỳ vọng của ô $(i, j)$ là: $e_{ij} = n \times P(Hàng\ i) \times P(Cột\ j) = n \times \frac{\text{Hàng } i}{n} \times \frac{\text{Cột } j}{n} = \frac{\text{Hàng } i \times \text{Cột } j}{n}$.
Chặng 5: Trực giác hình học về Bậc tự do $(r - 1)(c - 1)$
Xét một bảng tiếp biến gồm $2$ hàng và $3$ cột (như bài toán hãng bia: Giới tính Nam/Nữ $\times$ 3 loại bia). Tổng các hàng và tổng các cột đều đã được xác định trước từ dữ liệu khảo sát.
Vì sao số bậc tự do của bảng này lại là $(2 - 1)(3 - 1) = 1 \times 2 = 2$?
Bạn chỉ có quyền tự do điền số vào đúng $2$ ô; khi $2$ ô này có số liệu, toàn bộ $4$ ô còn lại tự động bị khóa chặt để thỏa mãn tổng hàng và cột.
Hãy tưởng tượng bạn có bảng 2 hàng, 3 cột với tổng hàng và tổng cột cố định. Nếu bạn tự chọn số cho ô (Hàng 1, Cột 1) và ô (Hàng 1, Cột 2), thì ô (Hàng 1, Cột 3) và cả Hàng 2 có còn được tự do chọn nữa không?
Vì bảng có tổng cộng 6 ô, nhưng nhà nghiên cứu luôn phải bỏ bớt 4 ô có phương sai lớn nhất.
Ta không bỏ bất kỳ ô nào; công thức kiểm định tính tổng trên tất cả $2 \times 3 = 6$ ô của bảng.
Vì công thức yêu cầu lấy tích của số hàng trừ đi số cột: $(r - c) = (3 - 2) = 1$.
Công thức bậc tự do là tích $(r - 1)(c - 1)$, không phải là phép trừ giữa các chiều của bảng.
Vì nghiên cứu chỉ quan tâm đến 2 nhãn hiệu bia bán chạy nhất trên thị trường.
Bậc tự do phản ánh số chiều tự do toán học của ma trận dữ liệu khi có các biên tổng cố định, không phụ thuộc vào thứ hạng thương hiệu.
Trong bảng tiếp biến kích thước $r \times c$, mỗi hàng bị mất 1 bậc tự do do tổng hàng cố định, và mỗi cột mất 1 bậc tự do do tổng cột cố định. Do đó, vùng tự do biến thiên thực sự chỉ là một góc ma trận kích thước $(r - 1) \times (c - 1)$.
Chặng 6: Quy luật bảo toàn bậc tự do khi ước lượng tham số ($df = k - p - 1$)
Tại siêu thị Dubek's Food Market, để kiểm định xem số lượng khách đến có tuân theo **phân phối Poisson** hay không, ta chia dữ liệu thành $k = 9$ nhóm. Vì tham số kỳ vọng $\mu$ của tổng thể chưa biết, nhóm nghiên cứu phải dùng trung bình mẫu $\bar{x} = 5$ để ước lượng $\mu$.
Công thức bậc tự do tổng quát là $df = k - p - 1$ (với $p$ là số tham số ước lượng từ mẫu). Trong bài toán phân phối Poisson này, $df$ bằng bao nhiêu?
$df = 9 - 1 - 1 = 7$, vì việc ước lượng tham số trung bình $\mu$ đã lấy đi mất $1$ bậc tự do của dữ liệu mẫu.
Phân phối Poisson chỉ có duy nhất một tham số đặc trưng là $\mu$. Khi phải dùng dữ liệu mẫu để ước lượng $\mu$, ta có $p = 1$. Hãy thay vào công thức $k - p - 1$!
$df = 9 - 1 = 8$, vì chỉ có duy nhất một ràng buộc là tổng các tần số kỳ vọng bằng cỡ mẫu.
Nếu tham số $\mu$ được biết trước từ lý thuyết thì $df = k - 1 = 8$. Nhưng ở đây $\mu$ chưa biết và phải ước lượng từ dữ liệu mẫu!
$df = 9 - 2 - 1 = 6$, vì phân phối Poisson luôn yêu cầu ước lượng cả kỳ vọng và phương sai.
Trong phân phối Poisson, phương sai luôn đúng bằng kỳ vọng ($\sigma^2 = \mu$), nên ta chỉ cần ước lượng một tham số duy nhất là $\mu$ ($p = 1$).
$df = 9$, vì phân phối Poisson là phân phối vô hạn nên không bị giới hạn bậc tự do.
Số bậc tự do không thể bằng đúng số nhóm $k$ vì luôn tồn tại ràng buộc về tổng xác suất bằng 1.
Nguyên lý vàng: "Mỗi tham số tổng thể phải ước lượng từ mẫu sẽ làm mất đi đúng 1 bậc tự do"! Phân phối Poisson chỉ có $1$ tham số $\mu$ ($p = 1$), do đó $df = k - 1 - 1 = k - 2$. Với $k = 9$ nhóm, ta có $df = 7$.
Chặng 7: Bài toán Biến liên tục & Kiểm định Phân phối Chuẩn
Công ty Chemline kiểm định xem điểm thi tuyển dụng của $50$ ứng viên có tuân theo **phân phối chuẩn** hay không. Vì điểm số là biến ngẫu nhiên liên tục, sách giáo khoa hướng dẫn chia đường cong chuẩn thành $10$ khoảng có xác suất bằng nhau ($10\%$). Ta ước lượng $\mu$ bằng $\bar{x} = 68.42$ và $\sigma$ bằng $s = 10.41$.
Tại sao lại phải chia các khoảng có xác suất bằng nhau? Và số bậc tự do $df$ ở đây là bao nhiêu?
Chia như vậy để mỗi khoảng đều có tần số kỳ vọng $e_i = 50 \times 0.10 = 5 \ge 5$; và vì ước lượng cả $\mu$ lẫn $\sigma$ ($p = 2$) nên $df = 10 - 2 - 1 = 7$.
Phân phối chuẩn được định nghĩa bởi 2 tham số: trung bình $\mu$ và độ lệch chuẩn $\sigma$. Vì cả hai đều phải ước lượng từ mẫu nên $p = 2$. Áp dụng $df = k - p - 1$ với $k = 10$!
Để các khoảng có độ rộng bằng nhau trên trục điểm số; và số bậc tự do sẽ là $df = 10 - 1 = 9$.
Độ rộng của các khoảng điểm số không bằng nhau (khoảng ở giữa hẹp, hai khoảng ở đuôi rộng vô tận). Quan trọng là diện tích xác suất dưới đường cong bằng nhau!
Vì phân phối chuẩn đối xứng nên bắt buộc phải chia chẵn 10 khoảng; và $df = 10 - 2 = 8$.
Đừng quên công thức tổng quát là $k - p - 1$. Trừ 2 tham số và còn phải trừ thêm 1 bậc tự do cho ràng buộc tổng xác suất!
Để điểm trung bình luôn nằm ở khoảng thứ 5; và $df = (10 - 1)(2 - 1) = 9$.
Công thức $(r-1)(c-1)$ là của bảng tiếp biến 2 chiều. Đây là kiểm định độ phù hợp 1 biến phân loại nên dùng $k - p - 1$.
Với biến liên tục, việc chia $10$ khoảng có cùng xác suất $10\%$ đảm bảo mọi ô đều thỏa mãn quy tắc an toàn $e_i = n \times 0.10 = 5 \ge 5$. Vì phân phối chuẩn cần ước lượng $2$ tham số ($\mu$ và $\sigma \Rightarrow p = 2$), bậc tự do bị trừ 2 đơn vị: $df = k - p - 1 = 10 - 2 - 1 = 7$.
Chặng 8: Ranh giới xấp xỉ $e_i \ge 5$ & Kỹ thuật gộp nhóm
Trong kiểm định Chi-bình phương (cả Đa thức, Độc lập, Poisson hay Phân phối chuẩn), quy tắc ngón tay cái luôn yêu cầu: Mọi tần số kỳ vọng $e_i$ hoặc $e_{ij}$ phải đạt tối thiểu từ $5$ trở lên.
Bản chất của điều kiện $e_i \ge 5$ là gì? Và khi gặp các nhóm có $e_i < 5$ (như nhóm khách đến bằng 0 hoặc 1 ở siêu thị Dubek) thì ta giải quyết chuẩn mực như thế nào?
Phân phối Chi-bình phương liên tục là xấp xỉ cho dữ liệu đếm rời rạc; nếu $e_i < 5$ sai số sẽ rất lớn, giải pháp là gộp nhóm nhỏ đó với nhóm liền kề để đạt $e \ge 5$.
Tần số đếm là số nguyên rời rạc ($0, 1, 2...$), trong khi đường cong $\chi^2$ trơn mượt liên tục. Để định lý giới hạn trung tâm bảo đảm xấp xỉ tin cậy, cỡ mẫu kỳ vọng mỗi nhóm phải đủ lớn ($\ge 5$).
Vì công thức chứa mẫu số $e_i$; nếu $e_i < 5$ máy tính sẽ tự động coi như phép chia cho số $0$ và phát sinh lỗi chia.
Máy tính chỉ lỗi khi mẫu số bằng đúng 0. Nếu $e_i = 0.86$ hay $4.31$ thì phép chia vẫn thực hiện hoàn toàn bình thường về mặt số học.
Nếu có bất kỳ nhóm nào có $e_i < 5$, nhà nghiên cứu bắt buộc phải hủy bỏ toàn bộ cuộc khảo sát và làm lại từ đầu.
Các nhà thống kê không lãng phí công sức như vậy. Hãy nhớ cách siêu thị Dubek gộp nhóm khách đến 0 và 1 thành một nhóm chung!
Quy tắc này chỉ áp dụng cho kiểm định tính độc lập, còn kiểm định độ phù hợp thì $e_i$ bằng bao nhiêu cũng được.
Quy tắc $e \ge 5$ áp dụng bắt buộc cho tất cả các loại kiểm định Chi-bình phương vì cùng dùng chung định lý xấp xỉ phân phối.
Định lý giới hạn bảo đảm phân phối của $\sum \frac{(f-e)^2}{e}$ tiệm cận phân phối $\chi^2$ chỉ khi cỡ mẫu kỳ vọng đủ lớn ($e \ge 5$). Khi một nhóm có $e_i < 5$, ta gộp nhóm đó với nhóm liền kề, làm giảm số nhóm $k$ và từ đó bậc tự do $df$ cũng giảm tương ứng, bảo toàn tính chuẩn xác cho giá trị $p\text{-value}$!