Tình huống khởi đầu: Khảo sát thu nhập 5 nhân viên: 12 triệu, 14 triệu, 15 triệu, 18 triệu và 300 triệu (quản lý kiêm cổ đông sáng lập). Thu nhập bình quân tính ra là 71,8 triệu/tháng.
Theo bạn, tại sao việc áp dụng phép kiểm định tham số (dựa vào trung bình cộng \(\mu\) và giả định phân phối chuẩn) lại dẫn đến kết luận sai lệch nghiêm trọng trong trường hợp này?
Vì điểm ngoại lai 300 triệu làm phân phối bị lệch mạnh (skewed); khi đó Trung vị (15 triệu) mới là thước đo vị trí trung tâm chuẩn xác.
Vì giá trị trung bình cộng luôn luôn phản ánh trung thực mức thu nhập của tuyệt đại đa số người lao động.
Vì phép kiểm định tham số không quan tâm đến hình dạng phân phối hay sự xuất hiện của các điểm ngoại lai.
Vì số trung vị cũng bị giá trị 300 triệu kéo lệch lên mức 71,8 triệu y như số trung bình.
Khi phân phối bị lệch hoặc chứa ngoại lai, Phương pháp phi tham số (Distribution-free methods) là giải pháp bắt buộc vì nó không đòi hỏi giả định về dạng phân phối chuẩn và sử dụng Trung vị (Median) làm thước đo hội tụ trung tâm.
Tình huống kiểm định: Siêu thị Lawler kiểm định doanh số sản phẩm khoai tây chiên mới so với mức trung vị kỳ vọng là 450 USD/tuần (\(H_0: \text{Median} = 450\)). Mười cửa hàng ngẫu nhiên cho kết quả: 7 cửa hàng bán trên 450 USD và 3 cửa hàng bán dưới 450 USD.
Trong Kiểm định Dấu (Sign Test), tại sao bài toán lại được quy đổi thành phép thử nhị thức với xác suất thành công \(p = 0{,}50\)?
Vì theo định nghĩa, trung vị chia đôi tổng thể thành hai nửa bằng nhau (50% lớn hơn, 50% nhỏ hơn), tương đương xác suất tung đồng xu.
Vì quy ước quốc tế mặc định gán xác suất \(p = 0{,}50\) cho mọi bài toán kinh doanh để dễ tính toán.
Vì kiểm định dấu chỉ áp dụng được khi độ lệch chuẩn của tổng thể được chứng minh là bằng 0.
Vì nếu không đặt \(p = 0{,}50\) thì phần mềm máy tính không thể xuất được giá trị p-value.
Dưới giả thuyết \(H_0: \text{Median} = \text{Median}_0\), mỗi quan sát có xác suất độc lập rơi vào phía lớn hơn mang dấu \((+)\) với \(p = 0{,}50\). Số dấu cộng quan sát được tuân theo phân phối nhị thức \(B(n, 0{,}50)\).
Tình huống mẫu lớn: Khảo sát giá bán 60 ngôi nhà để kiểm định xem giá trung vị có thấp hơn 236.000 USD hay không. Kết quả có 22 dấu \(+\) và 38 dấu \(-\). Khi xấp xỉ phân phối nhị thức bằng phân phối chuẩn với \(\mu = 30\) và \(\sigma = 3{,}873\), ta cần tính xác suất có từ 22 dấu \(+\) trở xuống.
Tại sao khi tính giá trị \(z\), ta không lấy trực tiếp giá trị 22 mà phải dùng giá trị 22,5 (áp dụng hệ số hiệu chỉnh liên tục - continuity correction factor)?
Vì phân phối nhị thức là rời rạc còn phân phối chuẩn là liên tục; điểm rời rạc 22 được đại diện bởi đoạn liên tục từ 21,5 đến 22,5.
Vì công thức thống kê luôn cộng thêm 0,5 để bù đắp cho sai số do làm tròn số thập phân.
Vì cỡ mẫu 60 là chưa đủ lớn nên phải cộng thêm 0,5 để phân phối trở về dạng chuẩn tắc.
Vì việc cộng 0,5 là tùy chọn của nhà nghiên cứu, dùng 22 hay 22,5 đều cho kết quả hoàn toàn như nhau.
Khi dùng xấp xỉ chuẩn cho biến ngẫu nhiên rời rạc, diện tích tương ứng với \(X \le 22\) trong phân phối nhị thức bao gồm toàn bộ cột số 22, tức tính đến cận trên 22,5. Bỏ qua hệ số hiệu chỉnh liên tục (\(\pm 0{,}5\)) sẽ làm sai lệch giá trị \(z\) và \(p\)-value.
Nghiên cứu thị hiếu: 14 khách hàng được mời nếm thử không dán nhãn hai loại nước cam Citrus Valley và Tropical Orange. Kết quả: 2 người thích Citrus Valley (dấu \(+\)), 10 người thích Tropical Orange (dấu \(-\)), và 2 người không phân biệt được sự khác nhau (hòa).
Quy tắc chuẩn mực của kiểm định dấu yêu cầu xử lý 2 khách hàng không thể hiện thị hiếu (hòa) này như thế nào?
Loại bỏ 2 người này ra khỏi phân tích và tiếp tục kiểm định với cỡ mẫu hiệu dụng \(n = 12\).
Gán cho mỗi thương hiệu thêm 1 dấu cộng để đảm bảo đủ tổng số 14 người ban đầu.
Hủy bỏ toàn bộ cuộc thử nghiệm vì dữ liệu không đạt tính nhất quán 100%.
Gán cả 2 người này dấu cộng cho sản phẩm ít người thích hơn để cân bằng mẫu.
Trong Sign Test (cả 1 mẫu lẫn mẫu cặp), các quan sát hòa (bằng giá trị kiểm định hoặc không chênh lệch) không cung cấp bằng chứng về chiều hướng khác biệt. Quy tắc thống kê là loại bỏ chúng và thu hẹp kích thước mẫu \(n\).
Tình huống gán hạng: Khi xếp hạng dữ liệu từ nhỏ đến lớn cho kiểm định phi tham số, sau khi xếp hạng 1, 2, 3 thì gặp hai quan sát có giá trị hoàn toàn bằng nhau (ví dụ: cùng có số dư 950 USD) chiếm hai vị trí thứ 4 và thứ 5 trong dãy sắp xếp.
Quy tắc gán thứ hạng chuẩn trong các phương pháp phi tham số (Wilcoxon, MWW, Kruskal-Wallis) cho hai phần tử đồng hạng này là gì?
Gán cho cả hai phần tử thứ hạng trung bình của các vị trí chúng chiếm giữ, tức \((4 + 5) / 2 = 4{,}5\).
Tùy ý gán một phần tử hạng 4 và phần tử kia hạng 5 theo thứ tự nhập liệu ban đầu.
Gán cho cả hai cùng nhận thứ hạng nhỏ hơn là hạng 4 và bỏ qua hạng 5.
Loại bỏ cả hai quan sát khỏi nghiên cứu vì vi phạm tính duy nhất của thứ hạng.
Quy tắc vàng khi xếp hạng trong thống kê phi tham số là: Khi có các giá trị trùng lặp (ties), tất cả các giá trị đó đều được gán bằng trung bình cộng các thứ hạng mà chúng cùng chia sẻ. Quan sát tiếp theo sẽ nhận thứ hạng kế tiếp danh sách.
Tình huống nâng cao: Khi so sánh 2 phương pháp sản xuất theo mẫu cặp, Sign Test chỉ quan tâm xem \(A > B\) hay \(A < B\). Trong khi đó, Wilcoxon Signed-Rank Test lấy trị tuyệt đối sai biệt \(|d_i|\), xếp hạng độ lớn, rồi mới gắn lại dấu ban đầu để tính tổng hạng mang dấu dương \(T^+\).
Để kiểm định Wilcoxon Signed-Rank cho kết luận hợp lệ về sự khác biệt giữa hai trung vị, giả định cốt lõi nào về phân phối của các sai biệt phải được đáp ứng?
Phân phối của các sai biệt phải có tính chất đối xứng (symmetric), dù không nhất thiết phải tuân theo phân phối chuẩn.
Phân phối của các sai biệt bắt buộc phải tuân theo phân phối chuẩn tắc Gauss.
Phân phối của các sai biệt bắt buộc phải bị lệch sang phải (positive skewed).
Tất cả các sai biệt phải có giá trị dương thì kiểm định mới có giá trị thực thi.
Wilcoxon Signed-Rank tận dụng được cả hướng lẫn độ lớn của sai biệt. Nó đòi hỏi giả định phân phối sai biệt là đối xứng. Nếu phân phối của sai biệt bị lệch nặng (skewed), Sign Test lại là lựa chọn ưu tiên hơn.
Mở rộng ứng dụng: Điểm thi phần Viết của bài thi SAT được chuẩn hóa sao cho phân phối điểm có dạng đối xứng quanh giá trị trung tâm. Một nhà nghiên cứu muốn kiểm định xem trung vị điểm Viết của học sinh một trường có bằng 500 hay không mà không muốn giả định phân phối chuẩn.
Tại sao trong trường hợp này, Kiểm định Wilcoxon Signed-Rank cho 1 mẫu vừa là kiểm định về Trung vị (Median) vừa đồng thời là kiểm định về Trung bình (\(\mu\))?
Vì trong bất kỳ phân phối đối xứng nào, điểm trung vị và điểm trung bình luôn luôn trùng nhau.
Vì trong thống kê phi tham số, thuật ngữ 'trung bình' và 'trung vị' luôn luôn được định nghĩa là một.
Chỉ vì bài thi SAT có thang điểm từ 200 đến 800 nên trung bình mới bằng trung vị.
Vì kiểm định Wilcoxon đã bí mật tự chuyển đổi toàn bộ điểm số thành phân phối chuẩn.
Đối với một tổng thể có phân phối đối xứng, \(\text{Median} = \mu\). Do đó, phép kiểm định Wilcoxon cho 1 mẫu có thể dùng như một phép kiểm định tương đương phi tham số thay thế cho One-sample \(t\)-test về giá trị trung bình khi vi phạm phân phối chuẩn.
Tình huống ngân hàng: So sánh số dư tài khoản của Chi nhánh 1 (\(n_1 = 12\)) và Chi nhánh 2 (\(n_2 = 10\)). Thống kê kiểm định \(W = 169{,}5\) (tổng hạng chi nhánh 1). Giả thuyết tổng quát là: \(H_0\): Hai tổng thể đồng nhất vs \(H_a\): Hai tổng thể không đồng nhất.
Khi nào chúng ta được phép diễn giải kết luận bác bỏ \(H_0\) của MWW thành: "Mức số dư trung vị của Chi nhánh 1 cao hơn Chi nhánh 2" thay vì chỉ nói "hai tổng thể không đồng nhất"?
Khi có cơ sở hợp lý để giả định rằng hai tổng thể có cùng hình dạng phân phối (same shape) và chỉ dịch chuyển về mặt vị trí.
Trong mọi trường hợp, MWW luôn luôn mặc định so sánh hai trung vị mà không cần bất kỳ giả định nào.
Chỉ khi kích thước mẫu của hai chi nhánh bằng đúng nhau từng người một.
Chỉ khi cả hai chi nhánh đều được chứng minh là tuân theo phân phối chuẩn hoàn hảo.
Nếu không có giả định nào, MWW kiểm định tính đồng nhất của hai phân phối. Nếu giả định hai tổng thể có cùng hình dạng, sự khác biệt giữa hai mẫu chỉ là sự dịch chuyển tịnh tiến (shift in location), cho phép ta phát biểu bài toán dưới dạng so sánh hai trung vị (\(\text{Median}_1 - \text{Median}_2\)).
Tình huống tập đoàn Williams: Giám đốc nhân sự muốn so sánh xếp hạng hiệu quả công việc của các quản lý tốt nghiệp từ 3 trường đại học: A (\(n_1 = 7\)), B (\(n_2 = 6\)) và C (\(n_3 = 7\)). Tổng số nhân sự là \(n_T = 20\).
Kiểm định Kruskal-Wallis là giải pháp thay thế phi tham số cho ANOVA một chiều. Khi các mẫu đều có \(n_i \ge 5\), giá trị thống kê \(H = 8{,}92\) được so sánh với phân phối nào để tìm \(p\)-value?
Phân phối Chi-bình phương (\(\chi^2\)) với bậc tự do \(df = k - 1 = 3 - 1 = 2\) (kiểm định đuôi trên).
Phân phối Fisher \(F\) với bậc tự do tử số là 2 và bậc tự do mẫu số là 17.
Phân phối chuẩn tắc \(Z\) với kiểm định hai phía.
Phân phối Chi-bình phương với bậc tự do \(df = n_T - 1 = 19\).
Thống kê Kruskal-Wallis \(H\) đo lường mức độ phân tán giữa các tổng hạng bình phương của từng nhóm. Dưới giả thuyết \(H_0\) các tổng thể đồng nhất và \(n_i \ge 5\), \(H\) xấp xỉ phân phối \(\chi^2\) với \(df = k - 1\) và kiểm định luôn nằm ở đuôi trên (upper-tail test).
Tình huống kinh doanh: Một công ty muốn đánh giá mức độ đồng điệu giữa xếp hạng tiềm năng ứng viên lúc phỏng vấn (\(x_i\)) và xếp hạng doanh số thực tế sau 2 năm (\(y_i\)) trên mẫu 10 nhân viên. Hệ số tương quan hạng Spearman tính được là \(r_s = 0{,}733\).
Để kiểm định xem mối tương quan hạng này có ý nghĩa thống kê trong tổng thể hay không (\(H_0: \rho_s = 0\)), thống kê \(z\) được tính toán như thế nào khi \(n \ge 10\)?
\(z = \frac{r_s - 0}{\sigma_{r_s}} = r_s \sqrt{n - 1} = 0{,}733 \times \sqrt{9} = 2{,}20\) dựa trên xấp xỉ phân phối chuẩn.
\(z = r_s \times n = 0{,}733 \times 10 = 7{,}33\) vì cỡ mẫu là 10.
Không cần tính z vì chỉ cần \(r_s > 0{,}5\) là mặc định có ý nghĩa thống kê mà không cần kiểm định.
\(z = \frac{r_s}{n^2} = 0{,}733 / 100 = 0{,}00733\).
Hệ số tương quan hạng Spearman (\(r_s\)) đo lường mối liên hệ đơn điệu dựa trên sai biệt thứ hạng \(d_i = x_i - y_i\). Khi \(n \ge 10\), phân phối chọn mẫu của \(r_s\) xấp xỉ chuẩn với trung bình bằng 0 và độ lệch chuẩn \(\sigma_{r_s} = \sqrt{1/(n - 1)}\), cho phép kiểm định nhanh qua thống kê chuẩn tắc \(z\).