Bạn đã hoàn thành trọn vẹn 12 chủ đề từ Biến ngẫu nhiên, Phân phối đều, Kỳ vọng, Độ lệch chuẩn, Phân phối Nhị thức, Poisson đến Siêu bội và Ứng dụng phần mềm thực tế.
Chủ đề 1 / 12: Nhận diện Biến Ngẫu Nhiên (Mục 5.1)
Tại một trạm thu phí cao tốc, người ta quan sát hoạt động trong 1 giờ. Nếu gọi \( X \) là "số lượng xe ôtô đi qua trạm trong 1 giờ", thì \( X \) thuộc loại biến ngẫu nhiên nào và vì sao?
Biến ngẫu nhiên rời rạc, vì số lượng xe chỉ nhận các số nguyên không âm \( 0, 1, 2, 3, \dots \)
Biến ngẫu nhiên liên tục, vì số lượng xe trong 1 giờ có thể rất lớn lên đến hàng nghìn chiếc.Độ lớn của con số không quyết định tính liên tục. Biến liên tục đòi hỏi phải nhận được mọi số lẻ trên một dải số thực (như thời gian hoặc cân nặng). Số xe không thể là 2.54 chiếc!
Biến ngẫu nhiên liên tục, vì khoảng thời gian quan sát (1 giờ) là đại lượng liên tục.Khoảng thời gian 1 giờ chỉ là khung thời gian cố định. Đối tượng ta đang đếm là "số chiếc xe", chứ không phải đo "thời gian giữa 2 xe".
Không phải biến ngẫu nhiên, vì đây là dữ liệu đếm thực tế có thể ghi nhận chính xác.Số lượng xe đến trạm trong 1 giờ tới là một kết quả chưa biết trước và có tính ngẫu nhiên, do đó nó hoàn toàn là một biến ngẫu nhiên.
Biến ngẫu nhiên là mô tả bằng số cho kết quả của một phép thử:
Rời rạc (Discrete): Nhận số giá trị hữu hạn hoặc vô hạn đếm được qua từng bước nhảy số nguyên: \( 0, 1, 2, \dots \) (số xe, số lỗi linh kiện, số người).
Liên tục (Continuous): Nhận bất kỳ giá trị nào trong một khoảng thực liên tục (thời gian chờ giữa các lần gọi, nhiệt độ phản ứng, cự ly tai nạn). Mẹo giáo trình: Chọn 2 điểm bất kỳ, nếu toàn bộ đoạn thẳng nối 2 điểm đó đều là giá trị khả dĩ thì đó là biến liên tục.
Chủ đề 2 / 12: Điều Kiện Tiên Quyết Của Hàm Xác Suất (Mục 5.2)
Một nhân viên bán hàng lập bảng dự báo số xe bán được trong ngày với xác suất: \( f(0) = 0.20 \), \( f(1) = 0.40 \), \( f(2) = 0.30 \), \( f(3) = 0.15 \). Bảng dự báo này có phải là một hàm xác suất rời rạc hợp lệ không?
Không hợp lệ, vì tổng tất cả xác suất \( \sum f(x) = 1.05 \), vượt quá 1.
Hợp lệ, vì tất cả các giá trị xác suất đều không âm (\( f(x) \ge 0 \)).Không âm mới chỉ là điều kiện cần thứ nhất. Một quy tắc bắt buộc của không gian biến cố là tổng xác suất của toàn bộ các trường hợp có thể xảy ra phải bằng bao nhiêu? Hãy cộng lại thử xem.
Hợp lệ, vì các giá trị \( x = 0, 1, 2, 3 \) là các số nguyên tăng dần hợp lệ.Tập giá trị của biến ngẫu nhiên là hợp lệ, nhưng hãy xem lại các con số xác suất \( f(x) \) tương ứng khi gộp lại.
Không hợp lệ, vì giá trị \( f(0) \) bắt buộc phải bằng 0.\( f(0) = 0.20 \) nghĩa là xác suất không bán được chiếc xe nào là 20%, điều này hoàn toàn bình thường trong kinh doanh. Vấn đề nằm ở tổng các xác suất.
Để hàm \( f(x) \) là một hàm xác suất rời rạc hợp lệ, bắt buộc phải thỏa mãn đồng thời 2 điều kiện:
\( f(x) \ge 0 \) với mọi giá trị \( x \).
\( \sum f(x) = 1 \) (tổng xác suất trên toàn bộ không gian mẫu phải bằng đúng 100%).
Chủ đề 3 / 12: Phân Phối Đều Rời Rạc (Mục 5.2)
Trong thí nghiệm gieo một con xúc xắc 6 mặt cân đối đồng chất, gọi \( X \) là số chấm ở mặt ngửa (\( x \in \{1, 2, 3, 4, 5, 6\} \)). Phân phối xác suất của \( X \) được biểu diễn bằng công thức nào?
Phân phối đều rời rạc: \( f(x) = \frac{1}{n} = \frac{1}{6} \) với mọi \( x \in \{1, 2, 3, 4, 5, 6\} \).
\( f(x) = \frac{x}{6} \) với \( x \in \{1, 2, 3, 4, 5, 6\} \).Nếu \( f(x) = x/6 \), thì mặt 6 chấm có xác suất \( f(6) = 6/6 = 1 \), vậy các mặt khác không bao giờ xuất hiện sao? Xúc xắc cân đối thì xác suất mỗi mặt phải thế nào?
\( f(x) = \frac{1}{x} \) với \( x \in \{1, 2, 3, 4, 5, 6\} \).Nếu dùng \( 1/x \), tổng xác suất \( 1/1 + 1/2 + 1/3 + \dots \) sẽ vượt xa 1, vi phạm điều kiện cơ bản của xác suất.
Phân phối Nhị thức với \( n = 6 \) và \( p = 0.5 \).Phép thử này chỉ gieo 1 con xúc xắc và có 6 kết quả đồng khả năng, không phải phép thử gồm nhiều lần thử với 2 kết cục thành công/thất bại.
Phân phối Đều rời rạc (Discrete Uniform Probability Distribution):
Là phân phối rời rạc đơn giản nhất được cho bởi công thức:
\[ f(x) = \frac{1}{n} \]
trong đó \( n \) là số lượng giá trị khả dĩ mà biến ngẫu nhiên có thể nhận. Mọi giá trị đều có xác suất xảy ra hoàn toàn ngang nhau.
Chủ đề 4 / 12: Bản Chất Của Kỳ Vọng \( E(X) \) (Mục 5.3)
Một đại lý thống kê số xe bán mỗi ngày: \( X = 0 \) (\( 10\% \)), \( X = 1 \) (\( 40\% \)), \( X = 2 \) (\( 30\% \)), \( X = 3 \) (\( 20\% \)). Giá trị kỳ vọng \( E(X) = 1.6 \) xe/ngày có ý nghĩa kinh doanh gì?
Là mức trung bình dài hạn, cho phép dự báo bình quân một tháng 30 ngày đại lý bán được \( 30 \times 1.6 = 48 \) xe.
Là số xe đại lý chắc chắn sẽ bán được trong ngày mai.Kỳ vọng không dự đoán một ngày cụ thể ngày mai. Ngày mai đại lý chỉ có thể bán được số nguyên xe: 0, 1, 2 hoặc 3 chiếc xe.
Số liệu này vô nghĩa vì thực tế không thể bán được 1.6 chiếc xe trong một ngày.Kỳ vọng \( E(X) \) là một giá trị trung bình có trọng số (weighted average). Nó không nhất thiết phải là một giá trị mà biến ngẫu nhiên có thể nhận được.
Số xe bán phổ biến nhất của cửa hàng là 1.6 chiếc.Giá trị có xác suất cao nhất (mode) ở đây là 1 xe (40%), chứ không phải 1.6 xe.
Kỳ vọng \( E(X) = \mu = \sum x \cdot f(x) \) là vị trí trung tâm của biến ngẫu nhiên:
Kỳ vọng là trung bình có trọng số với trọng số là các giá trị xác suất tương ứng.
Kỳ vọng không nhất thiết phải là giá trị mà \( X \) có thể nhận.
Đây là công cụ then chốt trong kinh doanh để dự báo doanh số, tính phí bảo hiểm hòa vốn, và ước lượng nhu cầu tồn kho dài hạn.
Chủ đề 5 / 12: Phương Sai vs. Độ Lệch Chuẩn (Mục 5.3)
Tại sao khi đo lường mức độ rủi ro hoặc biến động của doanh số bán hàng, các nhà quản lý thường thích sử dụng Độ lệch chuẩn (\( \sigma \)) hơn là Phương sai (\( \sigma^2 \))?
Vì độ lệch chuẩn có cùng đơn vị đo với biến ngẫu nhiên (chiếc xe), trong khi phương sai bị mang đơn vị bình phương (\(\text{xe}^2\)) rất khó diễn giải.
Vì phương sai luôn cho kết quả là số âm còn độ lệch chuẩn là số dương.Nhìn lại công thức phương sai: \( \sigma^2 = \sum (x - \mu)^2 f(x) \). Bình phương của độ lệch luôn \( \ge 0 \) và xác suất \( \ge 0 \), nên phương sai không bao giờ âm.
Vì độ lệch chuẩn tính toán nhanh hơn và không cần phải tính qua phương sai.Muốn tìm độ lệch chuẩn, ta bắt buộc phải tính phương sai trước rồi mới lấy căn bậc hai: \( \sigma = \sqrt{\sigma^2} \).
Vì phương sai chỉ áp dụng được cho mẫu số liệu nhỏ hơn 10 quan sát.Phương sai áp dụng cho mọi kích thước phân phối xác suất. Điểm mấu chốt nằm ở đơn vị tính toán thực tế.
Đo lường sự biến thiên (Variability):
Phương sai: \( \text{Var}(X) = \sigma^2 = \sum (x - \mu)^2 f(x) \) tính bằng bình phương độ lệch nên có đơn vị là \( \text{đơn vị}^2 \) (ví dụ: \( \text{xe}^2, \text{USD}^2 \)).
Độ lệch chuẩn: \( \sigma = \sqrt{\text{Var}(X)} \) là căn bậc hai số học, đưa mức độ phân tán trở về đúng đơn vị đo ban đầu của biến số, giúp so sánh trực tiếp với giá trị trung bình \( \mu \).
Chủ đề 6 / 12: Nhận Diện Phân Phối Nhị Thức (Mục 5.4)
Một nhân viên chăm sóc khách hàng gọi điện cho 5 vị khách hoàn toàn ngẫu nhiên và độc lập. Xác suất mỗi vị khách đồng ý gia hạn dịch vụ là \( p = 0.3 \). Điều gì đảm bảo biến cố này tuân theo phân phối Nhị thức?
Đủ 4 điều kiện: số lần thử cố định (\( n=5 \)), 2 kết cục (Đồng ý / Không), xác suất \( p=0.3 \) không đổi và các cuộc gọi độc lập.
Chỉ cần mỗi cuộc gọi có 2 kết quả (Đồng ý hoặc Từ chối) là đủ điều kiện phân phối Nhị thức.2 kết quả chỉ mới là định nghĩa của 1 phép thử Bernoulli đơn lẻ. Phân phối Nhị thức đòi hỏi cả tính độc lập và xác suất thành công không được thay đổi qua các lần thử.
Vì có thể áp dụng ngay công thức xác suất mà không cần quan tâm các cuộc gọi có độc lập với nhau hay không.Nếu các cuộc gọi không độc lập (ví dụ khách này tác động đến khách kia), thì các xác suất sẽ không thể nhân rời rạc với nhau được!
Vì tổng số cuộc gọi \( n = 5 \) là một số lẻ.Số lần thử \( n \) có thể là bất kỳ số nguyên dương nào, chẵn hay lẻ đều không ảnh hưởng đến điều kiện của phân phối Nhị thức.
Phân phối Nhị thức mô tả số lần thành công \( x \) trong \( n \) phép thử, với 4 tính chất bất biến:
Phép thử gồm chuỗi \( n \) lần thử đồng nhất.
Mỗi lần thử chỉ có 2 kết cục: Thành công (\( S \)) hoặc Thất bại (\( F \)).
Xác suất thành công \( p \) không đổi giữa các lần thử.
Các lần thử độc lập hoàn toàn.
Công thức xác suất: \( f(x) = \binom{n}{x} p^x (1-p)^{n-x} \), với \( E(X) = np \) và \( \text{Var}(X) = np(1-p) \).
Chủ đề 7 / 12: Bẫy Tư Duy: Tính Dừng vs. Tính Độc Lập (Mục 5.4)
Một nhân viên bán bảo hiểm đến thăm 10 gia đình được chọn ngẫu nhiên độc lập. Càng về cuối ngày, nhân viên càng mệt mỏi và mất nhiệt huyết, khiến xác suất bán được bảo hiểm ở gia đình thứ 10 giảm từ \( 0.10 \) xuống chỉ còn \( 0.05 \). Quá trình này có còn là một thí nghiệm Nhị thức không?
Không, vì vi phạm giả định tính dừng (stationarity assumption): xác suất thành công \( p \) đã bị thay đổi qua các lần thử.
Vẫn là thí nghiệm Nhị thức, vì quyết định mua của mỗi gia đình hoàn toàn độc lập với nhau.Tính độc lập (điều kiện 4) vẫn thỏa mãn, nhưng tính chất số 3 (xác suất p phải giữ nguyên không đổi) đã bị phá vỡ. Thí nghiệm nhị thức đòi hỏi CẢ 4 điều kiện!
Vẫn là thí nghiệm Nhị thức, chỉ cần lấy trung bình cộng của xác suất \( p = (0.10 + 0.05)/2 = 0.075 \).Công thức nhị thức được xây dựng dựa trên lũy thừa \( p^x \), nghĩa là mỗi lần thành công đều phải có cùng một xác suất p cố định, không thể dùng trung bình tùy tiện.
Chuyển sang phân phối Poisson vì có yếu tố thời gian trôi đi trong ngày.Poisson đo lường số lần xảy ra trong một khoảng liên tục, trong khi ở đây là đếm số người mua trên 10 gia đình cụ thể.
Điểm nhấn quan trọng của giáo trình: Người học rất dễ nhầm lẫn giữa Tính dừng (Stationarity) và Tính độc lập (Independence):
Độc lập (Independence): Kết quả của gia đình này không ảnh hưởng đến quyết định của gia đình kia.
Tính dừng (Stationarity): Xác suất thành công \( p \) phải được giữ cố định từ lần thử đầu tiên đến lần thử cuối cùng. Nếu người bán mệt mỏi, dây chuyền sản xuất nóng lên làm tăng tỷ lệ lỗi... thì tính dừng bị vi phạm và không được dùng công thức Nhị thức.
Chủ đề 8 / 12: Phân Phối Poisson & Quy Đổi Khoảng Thời Gian (Mục 5.5)
Tại cây ATM của Citibank, khách hàng đến ngẫu nhiên theo phân phối Poisson với trung bình \( \mu = 2 \) khách/phút. Nếu ngân hàng cần tính xác suất có đúng 5 khách đến trong khoảng thời gian 3 phút, tham số \( \mu \) đưa vào công thức Poisson phải là bao nhiêu?
\( \mu = 6 \) khách, vì thời gian tăng gấp 3 lần thì số lượt đến kỳ vọng cũng tăng gấp 3: \( \mu = 2 \times 3 = 6 \).
Giữ nguyên \( \mu = 2 \), vì đây là tham số bình quân gốc của cây ATM.Con số \( \mu = 2 \) chỉ là trung bình trong 1 phút. Trong 3 phút, số khách kỳ vọng đến giao dịch chắc chắn phải nhiều hơn chứ!
\( \mu = 2/3 \) khách, vì ta phải chia đều cho 3 phút.Nếu lấy 2 chia 3 thì số khách trung bình trong 3 phút lại ít hơn số khách trong 1 phút sao? Hãy suy luận theo chiều tăng của thời gian.
\( \mu = 5 \) khách, vì bài toán đang hỏi xác suất của 5 khách.Số 5 là giá trị của biến ngẫu nhiên \( x = 5 \) (số khách cần tính xác suất), không phải là giá trị trung bình kỳ vọng \( \mu \).
Trong phân phối Poisson \( f(x) = \frac{\mu^x e^{-\mu}}{x!} \):
Tham số \( \mu \) đại diện cho số lần xuất hiện trung bình trong khoảng đang xét.
Khi thay đổi độ dài khoảng quan sát (thời gian hoặc không gian), luôn luôn phải nhân/chia tỷ lệ tương ứng để tìm \( \mu \) mới trước khi thế vào công thức.
Chủ đề 9 / 12: Poisson Không Gian & Đặc Tính \( E(X) = \text{Var}(X) \) (Mục 5.5)
Một nghiên cứu chỉ ra rằng các vết nứt nghiêm trọng trên mặt đường cao tốc sau 1 tháng trải nhựa xuất hiện ngẫu nhiên theo phân phối Poisson với trung bình 2 vết nứt trên 1 dặm. Trên một đoạn đường dài 3 dặm, giá trị Phương sai (\( \sigma^2 \)) của số vết nứt là bao nhiêu?
\( \sigma^2 = 6 \), vì trong phân phối Poisson thì Phương sai luôn bằng đúng Kỳ vọng (\( \text{Var}(X) = \mu = 2 \times 3 = 6 \)).
\( \sigma^2 = 36 \), vì phương sai bằng bình phương của kỳ vọng (\( 6^2 = 36 \)).Đừng nhầm giữa phương sai và bình phương của kỳ vọng. Phân phối Poisson có một tính chất toán học rất đặc biệt giữa trung bình và phương sai!
\( \sigma^2 = \sqrt{6} \approx 2.45 \).\( \sqrt{6} \) là Độ lệch chuẩn (\( \sigma \)), câu hỏi đang hỏi về Phương sai (\( \sigma^2 \)).
\( \sigma^2 = 2 \), vì tỷ lệ vết nứt ban đầu là 2 vết/dặm.Khoảng cách đang xét là đoạn đường dài 3 dặm, bạn phải quy đổi kỳ vọng trước rồi mới xác định phương sai.
Hai đặc trưng độc đáo của phân phối Poisson:
Mở rộng phạm vi không gian: Không chỉ áp dụng cho thời gian (phút, giờ), Poisson áp dụng hoàn hảo cho các khoảng đo chiều dài, diện tích, thể tích (số lỗi trên 100m vải, số vết nứt trên 3 dặm đường, số rò rỉ trên 50 dặm ống dẫn).
Đặc tính cân bằng tuyệt đối:Kỳ vọng luôn bằng Phương sai:
\[ E(X) = \text{Var}(X) = \mu \implies \sigma = \sqrt{\mu} \]
Chủ đề 10 / 12: Bản Chất Phân Phối Siêu Bội (Mục 5.6)
Một hộp gồm \( N = 12 \) bóng đèn trong đó có \( r = 4 \) bóng hỏng. Một thợ điện lấy ngẫu nhiên liên tiếp \( n = 3 \) bóng không hoàn lại. Vì sao bài toán này bắt buộc dùng phân phối Siêu bội thay vì phân phối Nhị thức?
Vì việc rút không hoàn lại làm cho các lần thử không còn độc lập, xác suất rút trúng bóng hỏng bị thay đổi sau mỗi lần lấy.
Vì số lượng bóng hỏng (\( r=4 \)) lớn hơn số bóng lấy ra (\( n=3 \)).Số lượng bóng trong hộp nhiều hơn số bóng lấy ra là bình thường, không phải lý do quyết định loại phân phối.
Vì phân phối Nhị thức chỉ áp dụng cho đồng xu hoặc con xúc xắc.Phân phối Nhị thức áp dụng cho việc chọn mẫu nếu các lần chọn là độc lập (ví dụ: lấy mẫu CÓ hoàn lại).
Vì tổng thể \( N = 12 \) là một số chẵn.Kích thước tổng thể là số chẵn hay lẻ hoàn toàn không ảnh hưởng đến bản chất của phép thử xác suất.
Sự khác biệt sống còn giữa Siêu bội và Nhị thức:
Siêu bội (Hypergeometric): Lấy mẫu KHÔNG hoàn lại từ tổng thể hữu hạn \( N \). Các phép thử phụ thuộc lẫn nhau, xác suất thành công thay đổi sau mỗi lượt rút.
\[ f(x) = \frac{\binom{r}{x}\binom{N-r}{n-x}}{\binom{N}{n}} \]
Nhị thức (Binomial): Lấy mẫu CÓ hoàn lại (hoặc trên tổng thể vô hạn), các phép thử độc lập và xác suất \( p \) cố định.
Chủ đề 11 / 12: Tiệm Cận Siêu Bội Sang Nhị Thức (Mục 5.6)
Trong công thức phương sai của phân phối Siêu bội, thành phần \( \left(\frac{N-n}{N-1}\right) \) được gọi là gì, và khi nào ta có thể dùng phân phối Nhị thức để xấp xỉ phân phối Siêu bội?
Là hệ số hiệu chỉnh tổng thể hữu hạn; khi tổng thể \( N \) rất lớn so với cỡ mẫu \( n \) (\( n/N \le 0.05 \)), hệ số này tiến gần về 1 và ta có thể dùng Nhị thức với \( p = r/N \).
Là hệ số phương sai mẫu; chỉ dùng Nhị thức khi kích thước mẫu \( n > 30 \).Điều kiện xấp xỉ không nằm ở việc n > 30, mà là tỷ lệ mẫu rút ra so với toàn bộ tổng thể N phải đủ nhỏ để không làm xáo trộn xác suất ban đầu.
Là hệ số bất đối xứng; không bao giờ được phép dùng Nhị thức để thay thế Siêu bội vì bản chất toán học khác nhau.Trong thực tế thống kê công nghiệp, khi tổng thể N là hàng triệu sản phẩm mà chỉ rút 10 sản phẩm thì sự thay đổi xác suất là siêu nhỏ và hoàn toàn xấp xỉ được!
Là xác suất thất bại \( (1 - p) \); hệ số này luôn bằng 1 trong mọi trường hợp.Xác suất thất bại là \( (1 - r/N) \). Biểu thức \( (N-n)/(N-1) \) chỉ tiệm cận 1 khi N lớn hơn rất nhiều so với n.
Hệ số hiệu chỉnh tổng thể hữu hạn (Finite Population Correction Factor):
\[ \text{Var}(X) = n\left(\frac{r}{N}\right)\left(1 - \frac{r}{N}\right)\left(\frac{N-n}{N-1}\right) \]
Khi kích thước tổng thể \( N \) rất lớn so với mẫu \( n \) (thường thỏa mãn quy tắc ngón tay cái \( \frac{n}{N} \le 0.05 \)):
Thừa số \( \frac{N-n}{N-1} \to 1 \).
Việc lấy một phần tử ra hầu như không làm thay đổi tỷ lệ thành công của tổng thể.
Do đó, phân phối Siêu bội tiệm cận phân phối Nhị thức với tham số \( p = \frac{r}{N} \).
Chủ đề 12 / 12: Ứng Dụng Phần Mềm Thống Kê & Excel (Phụ lục 5.2)
Khi sử dụng các hàm xác suất trong Excel như BINOMDIST hoặc POISSON, tham số cuối cùng cumulative nhận giá trị FALSE và TRUE có ý nghĩa khác nhau như thế nào?
FALSE tính xác suất tại đúng điểm đó \( P(X = x) \); TRUE tính xác suất tích lũy từ 0 đến điểm đó \( P(X \le x) \).
FALSE tính phân phối rời rạc; TRUE tính phân phối liên tục.Hàm BINOMDIST hoặc POISSON chỉ dành riêng cho biến ngẫu nhiên rời rạc, không thể biến đổi thành liên tục bằng tham số này.
FALSE trả về giá trị kỳ vọng; TRUE trả về giá trị phương sai.Các hàm này dùng để tính giá trị xác suất (probability), không dùng để xuất ra kỳ vọng hay phương sai.
FALSE tính xác suất khi n nhỏ; TRUE tính xác suất khi n lớn hơn 100.Độ lớn của n được khai báo ở đối số thứ hai, tham số cumulative (tích lũy) mang một ý nghĩa xác suất toán học cụ thể.
Công thức thực hành trên Microsoft Excel:
Nhị thức: =BINOMDIST(x, n, p, cumulative)
Poisson: =POISSON(x, mean, cumulative)
Siêu bội: =HYPGEOMDIST(x, n, r, N)
Quy ước tham số tích lũy:
Điền FALSE: Tính xác suất tại đúng một giá trị \( P(X = x) \).
Điền TRUE: Tính xác suất cộng dồn (tích lũy) \( P(X \le x) = f(0) + f(1) + \dots + f(x) \). Ví dụ: muốn tính xác suất "có tối đa 2 người rút tiền", ta chỉ cần đặt TRUE.