Vì sao tương quan không đủ chứng minh quan hệ nhân quả
- Tương quan chỉ mô tả sự đồng biến, không xác định cơ chế tạo ra nó
- Biến nhiễu có thể khiến hai biến tương quan dù không có quan hệ nhân quả trực tiếp
- Nhân quả ngược có thể làm hướng tác động bị suy luận sai
- Thiên lệch chọn mẫu có thể tạo ra tương quan không tồn tại trong quần thể cần nghiên cứu
- Sai số và trùng hợp cũng cạnh tranh với lời giải thích nhân quả
- Muốn tiến gần đến kết luận nhân quả cần loại trừ các lời giải thích thay thế
Khoảng cách giữa hai khái niệm nằm ở các cách giải thích thay thế. Cùng một mẫu tương quan có thể được tạo ra bởi X gây Y, Y gây X, một biến thứ ba gây cả X lẫn Y, cách chọn mẫu làm xuất hiện liên hệ, sai số đo lường hoặc dao động ngẫu nhiên. Vì dữ liệu tương quan đơn thuần thường không phân biệt được các cơ chế này, quan sát “X đi cùng Y” chưa đủ để suy ra “X gây Y”.
Trong suy luận nhân quả hiện đại, vấn đề không phải tìm một dấu hiệu duy nhất biến tương quan thành nhân quả. Điều quan trọng là xem giả thuyết nhân quả có đứng vững khi đối mặt với những lời giải thích cạnh tranh hay không. Một tổng quan phương pháp gần đây cũng nhấn mạnh rằng các cân nhắc kiểu Bradford Hill không phải một checklist có thể tự động “chứng nhận” nhân quả; cần trực tiếp đánh giá các nguồn nhiễu, thiên lệch và sai số cạnh tranh với lời giải thích nhân quả.
Tương quan chỉ mô tả sự đồng biến, không xác định cơ chế tạo ra nó
Giả sử dữ liệu cho thấy khi X tăng thì Y cũng thường tăng. Kết quả này xác lập một association giữa X và Y, nhưng chưa cho biết đường nào đã tạo ra association đó.
Về mặt nhân quả, ít nhất có thể tồn tại các cấu trúc khác nhau:
· X gây thay đổi ở Y
· Y gây thay đổi ở X
· Z đồng thời ảnh hưởng X và Y
· Việc một đối tượng được đưa vào mẫu phụ thuộc vào X và Y, khiến chúng có vẻ liên quan
· Association xuất hiện do sai số hoặc dao động ngẫu nhiên
Các cấu trúc này có thể tạo ra dữ liệu quan sát khá giống nhau nhưng hàm ý hoàn toàn khác nhau. Vì thế hệ số tương quan, dù lớn hay nhỏ, tự nó không xác định được đường nhân quả nào là đúng.
Điểm này cũng giải thích vì sao tương quan rất mạnh vẫn chưa đủ. Độ mạnh của association chỉ mô tả mức độ hai biến đi cùng nhau; nó không loại trừ được một nguyên nhân chung có tác động mạnh lên cả hai biến. Ngược lại, một tác động nhân quả thật cũng không nhất thiết tạo tương quan lớn nếu có nhiều nguyên nhân khác đồng thời tác động đến kết quả.

Biến nhiễu có thể khiến hai biến tương quan dù không có quan hệ nhân quả trực tiếp
Một trong những cách giải thích thay thế quan trọng nhất là confounding — nhiễu. Nó xảy ra khi một biến thứ ba có quan hệ nhân quả với cả biến được xem là nguyên nhân và biến kết quả.
Có thể biểu diễn cấu trúc đơn giản như sau:
X ← Z → Y
Ở đây, Z tạo ra một đường liên hệ giữa X và Y. Vì vậy X và Y có thể tương quan ngay cả khi không tồn tại đường X → Y.
Ví dụ, nếu quan sát thấy những người mang bật lửa có nguy cơ mắc một bệnh liên quan đến hút thuốc cao hơn, không thể từ đó kết luận bật lửa gây bệnh. Hút thuốc có thể là biến chung giải thích cả việc mang bật lửa lẫn nguy cơ bệnh. Association giữa hai biến quan sát được là thật trong dữ liệu, nhưng cách diễn giải nhân quả ban đầu lại sai.
Đây không chỉ là vấn đề của mẫu nhỏ. Hernán và Robins lưu ý rằng khi có confounding, association vẫn không đồng nghĩa với causation ngay cả khi quần thể nghiên cứu rất lớn. Tăng kích thước mẫu có thể làm ước lượng association chính xác hơn về mặt thống kê nhưng không tự loại bỏ một cấu trúc nhân quả sai.
Vì vậy, câu hỏi thích hợp không phải chỉ là “X và Y có tương quan không?” mà còn là “có nguyên nhân chung nào tạo ra tương quan này không, và nghiên cứu đã xử lý nó như thế nào?”.
Nhân quả ngược có thể làm hướng tác động bị suy luận sai
Một association giữa X và Y không cho biết biến nào xảy ra trước về mặt nhân quả. Có thể người nghiên cứu giả định:
X → Y
trong khi cơ chế thực tế lại là:
Y → X
Đây là reverse causation — nhân quả ngược.
Chẳng hạn, nếu quan sát thấy những người có sức khỏe kém vận động ít hơn, association giữa vận động và sức khỏe chưa tự nó chứng minh thiếu vận động là toàn bộ nguyên nhân dẫn đến sức khỏe kém. Một phần association có thể hình thành theo chiều ngược lại: tình trạng sức khỏe đã khiến người đó giảm khả năng vận động.
Điều này làm tính trước–sau theo thời gian trở thành điều kiện quan trọng của suy luận nhân quả. Một nguyên nhân phải tồn tại trước tác động mà nó được cho là gây ra. Tuy nhiên, xác lập đúng thứ tự thời gian mới chỉ loại được một số lời giải thích; nó chưa tự động loại trừ confounding hoặc các dạng thiên lệch khác.
Do đó, “X xuất hiện trước Y” mạnh hơn việc chỉ thấy X và Y đồng thời biến động, nhưng vẫn chưa tương đương với “X gây Y”.
Thiên lệch chọn mẫu có thể tạo ra tương quan không tồn tại trong quần thể cần nghiên cứu
Association còn có thể xuất hiện do selection bias — thiên lệch chọn mẫu. Vấn đề xảy ra khi khả năng một đối tượng được quan sát hoặc được đưa vào phân tích phụ thuộc vào những yếu tố liên quan đến cả X và Y.
Khi đó, nghiên cứu không còn đơn thuần quan sát quan hệ tồn tại trong quần thể. Chính quá trình lọc ai được xuất hiện trong dữ liệu có thể tạo hoặc làm biến dạng association.
Một ví dụ trực giác là chỉ nghiên cứu một nhóm đã vượt qua một điều kiện tuyển chọn. Nếu cả X và Y đều làm tăng khả năng vượt điều kiện đó, việc chỉ quan sát những người đã được chọn có thể khiến X và Y mang một quan hệ thống kê khác với quan hệ trong toàn bộ quần thể.
Điểm quan trọng là association thu được không nhất thiết “sai” về mặt tính toán. Phép thống kê có thể hoàn toàn chính xác đối với mẫu đang có. Sai lầm xuất hiện khi diễn giải association đó như bằng chứng về cấu trúc nhân quả của quần thể rộng hơn.
Vì vậy, đánh giá quan hệ nhân quả phải xem xét không chỉ các biến đã đo mà cả cơ chế dữ liệu được tạo ra: ai được chọn, ai bị loại, ai mất theo dõi và điều kiện nào quyết định một quan sát xuất hiện trong mẫu.
Sai số và trùng hợp cũng cạnh tranh với lời giải thích nhân quả
Không phải mọi association quan sát được đều phản ánh một cấu trúc ổn định trong thế giới thực. Một phần có thể đến từ random error — sai số ngẫu nhiên, đặc biệt khi mẫu nhỏ hoặc khi kiểm tra rất nhiều giả thuyết.
Nếu thử đủ nhiều cặp biến, một số cặp có thể tình cờ cho association đáng chú ý dù giữa chúng không có quan hệ nhân quả. Đây là lý do một kết quả đơn lẻ thường yếu hơn một kết quả tái lập được trong các nghiên cứu độc lập và trong những thiết kế có nguồn sai số khác nhau.
Ngoài sai số ngẫu nhiên còn có sai số hệ thống như đo lường không chính xác, phân loại sai hoặc cách thu thập dữ liệu khác nhau giữa các nhóm. Những lỗi này có thể làm association mạnh hơn, yếu hơn hoặc thậm chí tạo ra association theo hướng không phản ánh quan hệ thật.
Vì thế, ý nghĩa thống kê cũng không phải giấy chứng nhận nhân quả. Một kết quả được ước lượng rất chính xác vẫn có thể là một association bị confounding hoặc selection bias. Ngược lại, việc lặp lại association ở nhiều bối cảnh chỉ làm lời giải thích ngẫu nhiên kém thuyết phục hơn; vẫn cần xem các nghiên cứu có cùng chia sẻ một nguồn thiên lệch hay không.
Muốn tiến gần đến kết luận nhân quả cần loại trừ các lời giải thích thay thế
Bằng chứng nhân quả mạnh lên khi dữ liệu và thiết kế nghiên cứu ngày càng khiến những lời giải thích không nhân quả trở nên khó duy trì.
Một số câu hỏi quan trọng gồm:
· Thời gian: X có xảy ra trước Y không?
· Confounding: Có nguyên nhân chung nào của X và Y chưa được kiểm soát không?
· Selection: Cách hình thành mẫu có thể tự tạo association không?
· Cơ chế: Có một quá trình hợp lý giải thích cách X có thể tác động đến Y không?
· Tái lập: Association có xuất hiện dưới những thiết kế, quần thể hoặc nguồn dữ liệu khác nhau không?
· Can thiệp: Khi chủ động thay đổi X, Y có thay đổi theo dự đoán nhân quả không?
· Độ bền: Kết luận có còn tồn tại khi thay đổi giả định hoặc phân tích các nguồn thiên lệch có thể có không?
Thí nghiệm ngẫu nhiên đặc biệt hữu ích vì quá trình phân bổ ngẫu nhiên nhằm tạo các nhóm có khả năng so sánh tốt hơn đối với những nguyên nhân nền của kết quả. Nếu khác biệt quan trọng giữa các nhóm chủ yếu là can thiệp được phân bổ, một khác biệt kết quả sau đó khó giải thích bằng confounding hơn so với một association quan sát thông thường.
Tuy nhiên, không phải câu hỏi nào cũng có thể hoặc nên được giải quyết bằng thí nghiệm ngẫu nhiên. Trong nghiên cứu quan sát, suy luận nhân quả thường phải dựa trên thiết kế nghiên cứu, giả định nhân quả được nêu rõ, kiểm soát confounding, phân tích thiên lệch, bằng chứng về thứ tự thời gian, cơ chế và sự nhất quán của nhiều nguồn bằng chứng. Các phương pháp hiện đại như đồ thị nhân quả và khung counterfactual được phát triển chính để làm những giả định này rõ ràng hơn thay vì xem một association đơn lẻ là đủ.
“Tương quan không chứng minh nhân quả” không có nghĩa tương quan vô dụng. Association thường là tín hiệu đầu tiên cho thấy một giả thuyết nhân quả đáng được kiểm tra. Điều nó không thể làm một mình là quyết định giữa nhiều cấu trúc cùng có khả năng tạo ra dữ liệu quan sát.
Khi thấy X tương quan với Y, có thể dùng một phép kiểm tra tư duy đơn giản: ngoài “X gây Y”, còn giả thuyết nào cũng giải thích được kết quả này? Nếu vẫn còn những khả năng hợp lý như Y gây X, Z gây cả hai, quá trình chọn mẫu tạo association hoặc kết quả chỉ là sai số, thì bằng chứng hiện tại chưa đủ để khẳng định quan hệ nhân quả.
Suy luận nhân quả vì thế là quá trình loại trừ và làm suy yếu các cách giải thích cạnh tranh, chứ không phải quá trình tìm một hệ số tương quan đủ lớn để đổi nhãn từ “liên hệ” sang “nguyên nhân”.
