Tình huống thực tế: Chuỗi siêu thị Food Lion sở hữu $1.200$ cửa hàng. Thay vì tốn kém kiểm kê thủ công toàn bộ, họ lấy mẫu ngẫu nhiên $50$ cửa hàng và tính được chỉ số trượt giá LIFO trung bình là $\bar{x} = 1.015$.
Tại sao ban kiểm toán không dùng duy nhất con số $1.015$ mà phải công bố khoảng ước lượng $[1.009,\, 1.021]$ với biên độ sai số $0.006$?
Vì trung bình mẫu luôn biến thiên ngẫu nhiên; dạng ước lượng $\bar{x} \pm E$ cung cấp thông tin rõ ràng về độ chuẩn xác và khoảng dao động tin cậy của tham số thực.
Vì trung bình mẫu $\bar{x}$ luôn sai lệch hoàn toàn so với giá trị thực tế của tổng thể trong mọi cuộc điều tra.
Mẫu ngẫu nhiên không thiên lệch là một ước lượng điểm không chệch rất tốt của $\mu$. Vấn đề không phải là nó 'sai hoàn toàn', mà là ta cần biết độ cận sát của nó với giá trị thực.
Vì theo quy định bắt buộc của kế toán LIFO, mọi chỉ số báo cáo tài chính đều phải ở dạng hai đầu mút.
Lý do cốt lõi nằm ở nguyên lý chọn mẫu xác suất trong thống kê, không phải chỉ là thủ tục kế toán.
Vì việc khảo sát $50$ cửa hàng không đủ điều kiện đại diện cho tổng thể $1.200$ cửa hàng.
Cỡ mẫu $n = 50$ lấy ngẫu nhiên hoàn toàn đủ điều kiện đại diện theo Định lý Giới hạn Trung tâm.
Ước lượng điểm đơn lẻ không cho biết nó đang ở cách tham số thực $\mu$ bao xa. Dạng tổng quát của ước lượng khoảng luôn là:
$$\text{Khoảng ước lượng} = \text{Ước lượng điểm} \pm \text{Biên độ sai số } (E)$$
Biên độ sai số $E$ phản ánh mức độ chuẩn xác của cuộc điều tra mẫu.
Khái niệm then chốt: Nhóm nghiên cứu lập được khoảng tin cậy $95\%$ cho mức chi tiêu trung bình của khách hàng là $[78.08,\, 85.92]$ đô-la.
Cách diễn giải nào sau đây về "Mức tin cậy $95\%$" là hoàn toàn chuẩn xác theo lý thuyết thống kê?
Nếu lặp lại quy trình lấy mẫu này vô số lần, $95\%$ số khoảng tin cậy được tạo ra sẽ thực sự bao trọn giá trị trung bình thực tế $\mu$.
Có đúng $95\%$ xác suất giá trị trung bình thực tế $\mu$ rơi vào khoảng từ $78.08$ đến $85.92$.
Đây là lỗi ngộ nhận phổ biến nhất! Tham số tổng thể $\mu$ là một hằng số cố định (chỉ là ta chưa biết), nó không phải biến ngẫu nhiên. Khi hai con số $78.08$ và $85.92$ đã được tính ra cụ thể, $\mu$ hoặc nằm trong đó, hoặc không nằm trong đó (xác suất chỉ là 1 hoặc 0).
Có $95\%$ khách hàng của cửa hàng chi tiêu trong khoảng từ $78.08$ đến $85.92$ đô-la.
Khoảng tin cậy là ước lượng cho giá trị trung bình của toàn bộ tổng thể ($\mu$), không phải khoảng phân tán của từng khách hàng riêng lẻ.
Có $5\%$ khả năng phép tính toán trung bình mẫu $\bar{x} = 82$ của chúng ta đã bị sai sót số học.
Mức ý nghĩa $5\%$ ($\alpha = 0.05$) đại diện cho rủi ro ngẫu nhiên khi lấy mẫu, không phải sai sót tính toán số học.
Lưu ý quan trọng: Tham số $\mu$ là một hằng số cố định, thứ ngẫu nhiên chính là vị trí của cái khoảng $[\bar{x} - E,\, \bar{x} + E]$ được tạo ra sau mỗi lần lấy mẫu. Mức tin cậy $95\%$ nghĩa là phương pháp xây dựng khoảng này có tỷ lệ thành công đạt $95\%$.
Quy luật đánh đổi: Khi ước lượng trung bình $\mu$ với độ lệch chuẩn $\sigma$ đã biết, nhóm nghiên cứu cân nhắc chuyển từ mức tin cậy $90\%$ ($z_{0.05} = 1.645$) sang $99\%$ ($z_{0.005} = 2.576$).
Điều gì sẽ xảy ra với biên độ sai số $E$ và độ rộng của khoảng tin cậy khi ta tăng mức tin cậy từ $90\%$ lên $99\%$ với cùng một mẫu dữ liệu?
Biên độ sai số $E$ tăng lên, làm cho khoảng tin cậy trở nên rộng hơn.
Khoảng tin cậy sẽ thu hẹp lại vì độ tin cậy cao hơn đồng nghĩa với kết quả chính xác hơn.
Hãy liên tưởng đến việc giăng lưới bắt cá: Muốn tự tin $99\%$ bắt dính mục tiêu (thay vì $90\%$), chiếc lưới bạn giăng ra phải lớn hơn hay nhỏ lại?
Độ rộng của khoảng không đổi vì độ lệch chuẩn $\sigma$ và cỡ mẫu $n$ được giữ nguyên.
Xem lại công thức $E = z_{\alpha/2} \frac{\sigma}{\sqrt{n}}$. Khi độ tin cậy tăng, hệ số $z_{\alpha/2}$ tăng từ $1.645$ lên $2.576$. Khi đó $E$ sẽ như thế nào?
Biên độ sai số giảm đi do mức rủi ro sai sót $\alpha$ giảm từ $0.10$ xuống $0.01$.
Rủi ro $\alpha$ giảm ở phần đuôi buộc giá trị giới hạn $z_{\alpha/2}$ phải lùi xa về hai phía, làm tăng tích số với sai số chuẩn.
Quy luật bất biến: Muốn tăng độ tin cậy (chắc chắn hơn), ta phải chấp nhận đánh đổi bằng việc mở rộng khoảng ước lượng. Để vừa có độ tin cậy cao vừa có khoảng ước lượng hẹp, cách duy nhất là phải tăng kích thước mẫu $n$.
Bản chất toán học: Khi $\sigma$ chưa biết, ta dùng độ lệch chuẩn mẫu $s = \sqrt{\frac{\sum (x_i - \bar{x})^2}{n - 1}}$ và sử dụng phân phối $t$ với $n - 1$ bậc tự do ($df$).
Tại sao tham số bậc tự do của phân phối $t$ trong ước lượng trung bình lại là $n - 1$ mà không phải là $n$?
Vì tổng các độ lệch luôn triệt tiêu $\sum (x_i - \bar{x}) = 0$, nghĩa là khi biết $n - 1$ độ lệch thì độ lệch cuối cùng bị cố định, chỉ còn $n - 1$ mẩu thông tin độc lập.
Vì công thức này trừ bớt đi $1$ phần tử ngoại lai lớn nhất trong mẫu để đảm bảo tính chuẩn tắc.
Phép chia cho $n - 1$ không hề loại bỏ bất kỳ dữ liệu nào của bạn; tất cả $n$ quan sát đều được sử dụng đầy đủ.
Vì William Gosset đã trừ đi $1$ quan sát đầu tiên để làm mẫu đối chứng trong thí nghiệm tại nhà máy bia Guinness.
Đây là một quy luật toán học thuần túy về số chiều độc lập của không gian vectơ, không phải quy ước thí nghiệm ngẫu nhiên.
Vì khi kích thước mẫu $n$ tăng lên, $n - 1$ sẽ nhanh chóng tiến về $0$.
Khi $n$ tăng thì $n - 1$ tiến về vô cùng ($\infty$), chứ không tiến về $0$.
Bậc tự do (Degrees of Freedom) là số mảnh thông tin độc lập còn lại sau khi đã tính một tham số trung gian ($\bar{x}$). Do đẳng thức $\sum (x_i - \bar{x}) = 0$, chỉ có đúng $n - 1$ độ lệch được tự do biến thiên.
Thách thức dữ liệu thực tế: Một cuộc khảo sát về giá trị tài sản ròng hoặc số tuần tìm việc của người lao động lớn tuổi thường có phân phối lệch phải mạnh (Right-skewed) với nhiều giá trị cực lớn.
Hiện tượng nào sẽ xảy ra khi ta áp dụng phân phối $t$ cho một mẫu nhỏ lấy từ tổng thể bị lệch phải nặng?
Trung bình mẫu $\bar{x}$ và độ lệch chuẩn mẫu $s$ tương quan thuận: Khi $\bar{x} < \mu$, $s$ cũng bị thu nhỏ lại làm biên độ sai số quá hẹp, khiến khoảng tin cậy dễ bỏ sót $\mu$.
Khoảng tin cậy tính ra luôn hoàn toàn đối xứng và không bị ảnh hưởng bởi độ lệch của tổng thể.
Phân phối $t$ dựa trên giả định tổng thể gốc có phân phối chuẩn. Nếu tổng thể bị lệch mạnh và mẫu quá nhỏ, mức tin cậy thực tế sẽ bị sai lệch so với mức danh định $95\%$.
Biên độ sai số sẽ tự động triệt tiêu về $0$ do các giá trị ngoại lai kéo lệch mẫu.
Điểm ngoại lai lớn làm tăng độ phân tán của dữ liệu, khiến $s$ tăng chứ không thể làm sai số triệt tiêu về 0.
Phân phối $t$ sẽ lập tức biến đổi thành phân phối đều (Uniform Distribution).
Hình dạng phân phối của dữ liệu không làm thay đổi định dạng lý thuyết của phân phối $t$, mà làm giảm độ chính xác của phép xấp xỉ.
Khuyến nghị thực hành từ chuyên gia: Khi tổng thể đối xứng, mẫu $n \ge 15$ đã cho xấp xỉ tốt. Nhưng nếu tổng thể bị lệch mạnh hoặc có điểm ngoại lai, các nhà thống kê khuyến nghị tăng kích thước mẫu lên tối thiểu $n \ge 50$ để đảm bảo khoảng tin cậy đạt đúng mức $95\%$.
Quy hoạch kích thước mẫu: Khi lên kế hoạch khảo sát lương khởi điểm của sinh viên mới tốt nghiệp từ $\$30.000$ đến $\$45.000$, hoàn toàn chưa có số liệu lịch sử nào về độ lệch chuẩn $\sigma$.
Cách tiếp cận nào được khuyến nghị để xác định giá trị quy hoạch cho $\sigma$ và mối quan hệ giữa $n$ với biên độ sai số $E$ là gì?
Ước tính thô $\sigma \approx \frac{\text{Range}}{4} = \frac{15.000}{4} = 3.750$; và nếu muốn giảm sai số $E$ đi một nửa thì cỡ mẫu $n$ bắt buộc phải tăng gấp $4$ lần.
Lấy giá trị trung bình cộng $\frac{30.000 + 45.000}{2} = 37.500$ làm $\sigma$; và giảm sai số đi một nửa thì chỉ cần gấp đôi cỡ mẫu.
Con số $37.500$ là điểm chính giữa của khoảng (trung bình), không phải độ lệch chuẩn. Hơn nữa, hãy nhớ công thức $n = \frac{z^2 \sigma^2}{E^2}$: $n$ tỉ lệ nghịch với bình phương của $E$!
Bắt buộc phải dừng cuộc nghiên cứu vì không thể tính cỡ mẫu khi chưa có giá trị chính xác tuyệt đối của $\sigma$.
Trong thực tế, ta hoàn toàn có thể dùng các giá trị quy hoạch ban đầu (planning value) như khảo sát thử hoặc ước lượng qua khoảng biến thiên (Range).
Ước tính $\sigma \approx \text{Range} \times 2$; và cỡ mẫu $n$ tăng tuyến tính bậc nhất theo $E$.
Theo quy tắc thực nghiệm, khoảng $95\%$ dữ liệu nằm trong phạm vi $\pm 2\sigma$ quanh trung bình (độ rộng là $4\sigma$), do đó $\sigma \approx \text{Range} / 4$.
Khi hoàn toàn thiếu thông tin, ta dùng quy tắc thực nghiệm:
$$\sigma \approx \frac{\text{Giá trị lớn nhất} - \text{Giá trị nhỏ nhất}}{4} = \frac{\text{Range}}{4}$$
Và từ công thức $n = \frac{(z_{\alpha/2})^2 \sigma^2}{E^2}$, quy luật bình phương chỉ ra: muốn sai số giảm $k$ lần thì kinh phí mẫu phải tăng $k^2$ lần.
Ước lượng Tỷ lệ: Để áp dụng phân phối chuẩn tắc $Z$ xây dựng khoảng tin cậy cho tỷ lệ $\bar{p} \pm z_{\alpha/2} \sqrt{\frac{\bar{p}(1 - \bar{p})}{n}}$, kích thước mẫu cần phải đáp ứng một điều kiện nền tảng.
Điều kiện cần và đủ nào về mặt số lượng quan sát để đảm bảo phân phối lấy mẫu của tỷ lệ $\bar{p}$ xấp xỉ tốt phân phối chuẩn?
Cả số trường hợp thành công kỳ vọng và thất bại kỳ vọng đều phải đạt tối thiểu bằng $5$ (tức $np \ge 5$ và $n(1 - p) \ge 5$).
Chỉ cần tổng kích thước mẫu $n \ge 30$, bất kể tỷ lệ quan sát được $\bar{p}$ là bao nhiêu.
Hãy cẩn thận: Nếu $n = 30$ nhưng sự kiện cực kỳ hiếm ($p = 0.01$), số trường hợp thành công chỉ là $0.3 < 5$, phân phối sẽ bị lệch trầm trọng và không thể coi là chuẩn được!
Tỷ lệ quan sát $\bar{p}$ bắt buộc phải đúng bằng $0.50$ trong mọi bài toán.
Tỷ lệ mẫu $\bar{p}$ phụ thuộc vào thực tế cuộc khảo sát, hoàn toàn không bắt buộc phải bằng 0.50.
Kích thước mẫu $n$ phải lớn hơn hoặc bằng $1.000$ quan sát.
Không cần thiết phải lên đến 1.000. Tiêu chuẩn vàng ở đây là số lần đếm thành công và thất bại tối thiểu.
Phân phối nhị thức của số đếm chỉ tiệm cận hình chuông đối xứng của phân phối chuẩn khi cả hai đuôi đều đủ 'dày', nghĩa là:
$$np \ge 5 \quad \text{và} \quad n(1 - p) \ge 5$$
Với các sự kiện cực hiếm ($p$ rất nhỏ), ta cần một cỡ mẫu $n$ lớn hơn rất nhiều để thỏa mãn điều kiện này.
Thăm dò dư luận xã hội: Các tổ chức thăm dò lớn (như Gallup, Harris) khi khảo sát bầu cử toàn quốc thường chọn cỡ mẫu từ $1.000$ đến $1.500$ người để đạt biên độ sai số $E \approx 0.03$ ($3\%$) ở mức tin cậy $95\%$.
Tại sao họ thường giả định giá trị quy hoạch $p^* = 0.50$ khi tính cỡ mẫu và tại sao hiếm khi họ tăng mẫu lên $10.000$ người?
Vì tích $p^*(1 - p^*)$ đạt cực đại tại $0.5$ (giúp bảo đảm an toàn mẫu tối đa); và tăng mẫu lên $10.000$ thì chi phí tăng gấp $10$ nhưng sai số chỉ giảm từ $3\%$ xuống khoảng $1\%$.
Vì mọi cuộc bầu cử luôn có kết quả chia đôi $50/50$, và mẫu trên $1.500$ người sẽ vi phạm Định lý Giới hạn Trung tâm.
Kết quả bầu cử rất hiếm khi chia đôi đúng 50/50. Và kích thước mẫu càng lớn thì Định lý Giới hạn Trung tâm càng phát huy hiệu quả, không hề có chuyện vi phạm.
Vì giá trị $p^* = 0.5$ làm cho cỡ mẫu tính ra là nhỏ nhất, giúp tiết kiệm chi phí phỏng vấn nhất.
Hãy thử so sánh tích: $0.1 \times 0.9 = 0.09$ còn $0.5 \times 0.5 = 0.25$. Tích $0.25$ lớn hơn sẽ làm cho $n$ lớn nhất (an toàn nhất), chứ không phải nhỏ nhất!
Vì các phần mềm máy tính hiện nay chỉ có thể xử lý tập dữ liệu tối đa là $1.500$ dòng.
Máy tính xử lý hàng triệu dòng dữ liệu dễ dàng. Rào cản ở đây là chi phí khảo sát thực tế và quy luật lợi ích biên giảm dần.
Chọn $p^* = 0.50$ là giải pháp "bảo hiểm rủi ro" (play it safe) vì nó tạo ra cỡ mẫu lớn nhất:
$$n = \frac{(z_{\alpha/2})^2 (0.5)(0.5)}{E^2}$$
Đồng thời, quy mô mẫu $n \approx 1.000 - 1.500$ là "điểm ngọt" (sweet spot) tối ưu giữa độ chính xác và ngân sách kinh tế của ngành thăm dò thế giới.