顯示具有 統計 標籤的文章。 顯示所有文章
顯示具有 統計 標籤的文章。 顯示所有文章

2020-03-05

科學的界限六:重現性危機

本文亦發表在鳴人堂沃草烙哲學

在心理學只有40%的研究結果可以重複,癌症醫學更只有10%。有超過一半的科學家認為科學界正面臨重現性危機(replication crisis)。

理想中的科學,是100個人在100個不同的地方做一樣的實驗,結果都會一樣,但現實並非如此,尤其是在生物學、醫學、心理學和經濟學。這是因為生物系統太複雜,總是有許多無法控制的變因和測量誤差影響實驗結果,無法一翻兩瞪眼判斷假說是否正確,而必須用複雜的統計分析,來推測結果「比較可能」是支持還是否定某個假說。但即使用了統計學,還是有許多原因會讓我們誤以為,某個錯誤的假說很可能是正確的。

以生醫實驗為例,人類有大約兩萬個基因,假設其中100個會影響癌症好了(我們不知道),而我們想要把它們找出來。依常見的實驗方法,假陽性(不影響癌症但我們以為它會)的機率是5%,假陰性(會影響癌症但我們沒發現)的機率不一定,我們假設是20%好了。我們研究了所有兩萬個基因座。假陽性的基因座會有995個((20000-100)×5%),正確找出來沒有變成假陰性的則有80個(100×(1-20%))。所以我們找出來的1075個我們認為會影響癌症的基因中,只有80個是真的會影響癌症的,而且另外有20個沒找到。

實際上假陽性的機率遠高於5%,原因之一是重複實驗和發表偏誤:假設有五個團隊在測試同樣的假說,每個團隊各自做了四種不同的實驗,就算他們測試的假說是錯的,也會有一次實驗結果因為巧合,而在統計上告訴研究人員這個假說可能是對的,然後這一組結果會發表在期刊上;另外19組實驗不會,因為不管從科學家的觀點還是期刊的觀點,成功證實某件事都比沒有證明有趣多了。

因為上述這些原因,有人估計那些發表在期刊上的研究有大半都是錯的。我要強調一點:以上是說就算沒有人造假,而且每個人都用很嚴謹很正確的方式做研究,還會有大半的研究結果是錯的。而實際上研究有瑕疵的頻率可能不低。

無意間出錯的機會很高,有時候是很簡單的小粗心,像是樣本搞混、核磁共振的左右弄反、Excel表格選錯格。有時候是意外的變因沒有控制,例如實驗用的器材品質不佳汙染結果、或是男性研究員造成實驗鼠的壓力。

還有些是訓練不足造成的,像統計方法用錯、把「沒有資料」當成「數值是零」、或是程式碼寫錯等等也都常發生。這些失誤有時候會在同儕審查時發現,但有時候那些無償幫忙的審查員沒時間看仔細。而且如果是實驗過程中的失誤、或是沒有公開的資料,那根本無法審查。

還有些錯誤是有意的,可能的動機很多。很多時候因為研究人員的壓力和訓練不足,會為了得出某個想要的結果而重複做實驗、改實驗、換統計方法、挑除不好看的數據,直到出現想要的結果。然後,說服自己那些不符預期的結果,都是因為操作有誤或是樣本不正常。

這其實就是造假,但因為許多學校並不會在研究方法和統計學的課程中明確指出這是錯的,許多人都以為只要沒有直接捏造數據就不是造假。於是,研究生要畢業、要滿足指導教授的期望;教授要升等、要幫實驗室爭取到研究經費;期刊要發表吸引人的結果,就造成許多人做這種事。

當然,直接造假也有。常見的是膠體電泳或顯微鏡照片中,兩個不同情況的實驗結果卻長得一模一樣,所以被抓到是修圖。但不難想像有更多數據造假是沒被抓到的。

以上的各種問題如果有其他團隊的人重複實驗,通常會因為無法複製相同的結果,而得知研究有問題。但是很少有人會重複做別人的實驗,因為那一點也不有趣。就算有人想要重複實驗,常常也很困難:實驗人員很容易覺得某個細節大家都知道,或是不會影響結果,而沒有紀錄下來,然而該細節其實至關重要。也有些研究人員會為了保持領先,故意把一部份的流程寫得模糊或是不分享。

就算不打算重複實驗,光是取得原始資料來檢查分析過程有無出錯,有時就已經很困難。不管是電子還是紙本資料,管理起來都不容易。尤其是數十年前己經發表在期刊上的研究,研究者沒什麼動機要妥善保存那些資料,常常教授退休或學生畢業後資料就找不到了(我同事的研究發現,「社會學習」這個主題的資料保存的半衰期約五年半)。

現在大多期刊會要求把資料上傳保存,但是期刊不會把關這些資料,如果資料有缺、有誤、或是說明不完整造成無法解讀,也不會被要求改正。常見的錯誤之一是Excel自動把SEPT2和MARCH1等基因名稱改成日期格式,造成資料無法讀取,有五分之一已發表的研究資料中有這種問題。如果研究中用到人,也常因為隱私權的問題無法公開原始數據,所以無法檢查。

就算發現了研究結果錯誤,要更正也很難。期刊和研究員常常為了自己的名譽,而拒絕承認錯誤。就算撤回了某篇研究,它也可能已經被許多人引用,許多人不會得知原本的研究有誤,甚至可能已經影響政策。例如2010年的一篇研究主張國債對經濟有不好的影響,於是各國採取了財政撙節政策。三年後有人發現那結果完全是錯的,研究者在Excel中選錯格子,但是財政撙節已經實施了。

這篇文章不是叫大家不要相信科學,也不是說不要做研究。上面提到的這些問題,科學界正在熱烈討論,找尋舒緩這些問題的方法。我想要透過這系列文章強調:科學不是萬能,其背後的哲學基礎有我們還不明白的地方,而且科學的進展非常複雜,會受到統計學限制、文化和各種人為失誤影響。科學進展的過程中會產生很多錯誤的研究,要從中單獨挑選幾篇文章來支持錯誤的論點也很容易,但長期下來我相信科學會帶我們走上正確的道路。科學確實是已知最能有效取得知識的方法之一,給了我們便宜的糧食、方便的智慧手機、救人無數的現代醫學……。我相信科學可以帶給我們很多利益和知識,但同時,我們也必須時常提醒自己要適度地在不疑處有疑。

參考資料:

2020-02-05

科學的界限四:控制變因、假相關和不存在的資料

本文亦發表在鳴人堂沃草烙哲學


很多科學研究人員都有一種誤會,以為在統計分析的時候控制了越多變因,結果越可靠。這類問題在生態學、流行病學、心理學和社會科學特別嚴重。在這些領域有大半的研究結論都是「在控制了A、B、C、D因子後,我們發現 X 對 Y 有影響」。但其實有一些變因不應該控制,如果控制了反而會造成錯誤的研究結果。

例如智商和心理學五大人格中的盡責性(Conscientiousness)應該沒有什麼因果關係,但是如果我們控制了教育程度或職場表現後,會發現智商和盡責性有負相關[1]。這是因為智商和盡責性都對念書和工作有幫助,所以當我們比較同樣教育程度的人時,智商高的人不用太盡責、盡責的人笨一點也沒關係[2]。

又例如女性在職場上受到不平等的對待,但如果我們控制了產業、職位和年資後,會發現女性的收入好像沒有低於男性、只差一點點、或甚至女性收入比較高[3]。這其實是因為只有非常有能力的女性才有辦法繼續在充滿歧視的環境中和男性競爭和升遷。 如果我們沒有控制職業,結果就會發現女性的收入低於男性,但是控制了反而變成沒有差別。幾年前Google發生性別收入不平等的爭論時,他們就用這種分析來宣稱女性的收入不低於男性[4]。(關於科學界、科技業和醫學界的性別問題可以參考本系列下一篇)

上述兩個例子中,因為控制了教育程度或職位這兩個變因而造成錯誤的推論,不控制這些變因研究結果才會正確,背後的原因其實一樣:這兩個變因是對撞變因(collider)。對撞變因可以這樣描述:在研究X和Y的關係時,如果X和Y都會影響C,C就是對撞變因。對撞變因在不同的研究領域和情境下有時又稱為選擇偏誤(selection bias)、倖存者偏誤(survival bias)、柏克森悖論(Berkson's paradox)或辛普森悖論(Simpson's paradox)。

控制對撞變因會造成假相關:兩個因素看起來有關,但其實這只是因為樣本被對撞變因限制過了。但是我們不能因為害怕假相關,就決定什麼變因都不要控制,因為也有些變因的效果正好相反:不控制它的時候才會造成假相關。

例如父母的教育程度,可能讓小孩的發育時的營養比較好,所以小孩的智商比較高,同時高教育程度父母更加教育小孩要盡責,若如此,不控制父母教育程度的話,就會發現智商高的人比較盡責。在此,父母教育程度是干擾變因,應該要控制。

然而,在很多研究題目中變因很多,而且組合成非常複雜的因果鍊,充滿干擾變因、中介變因、對撞變因、工具變因,無法釐清誰影響誰,這時候分析起來就困難了。



例如這個研究問題:足球比賽中,黑人運動員會不會因為歧視,而比較容易被舉紅牌出場?研究這個題目時,可能的變因包括身高、體重、球隊所屬國家、球員得黃牌的次數、球員的位置、裁判的族裔、對手的族裔、對手被捲入犯規的頻率……你看得出來哪些變因應該要控制,哪些不該嗎?

有研究者拿同一組數據,找了29組專業團隊(共61人)來分析這個問題,結果每組人分析的方法和算出來的數據結果都不一樣,三分之一的研究結論是沒有影響,三分之二的研究結論是有影響。[5]

(如果你懂一點統計,請注意,AIC、DIC、WAIC 等 model selection 方法並不能解決上述問題。AIC常會建議你控制對撞變因,因為它讓本來不存在的效果看起來更顯著。具體原因可參閱 Statistical Rethinking 或其他較新的統計學教科書。此外,先前在《科學的界限 - 2. 理論是真的嗎?》我也指出了簡單的模型沒理由就比較好)

更可怕的是有時候研究人員並沒有打算要控制什麼變因,但是社會/大自然/世界/蓋婭/老天爺已經幫你控制了某個對撞變因。

例如觀察醫院的病人時,發現得了 X 病的人大多也得 Y 病,於是以為是病理上有關係的併發症。這可能是因為只得其中一個病時,病人不會覺得有嚴重到需要去醫院。科學家如果只觀察醫院裡的病人,就會誤以為 X 和 Y 有因果關係。

例如有個假說是腦容量大的生物有比較高的創造力。要分析這個問題會遇到的麻煩是維持巨大的頭腦很耗能,有害生存,而創造力則有益生存;如果我們只觀察了存活到現在的生物,就會發現兩者有正相關,好像證明了腦容量大會提高創造力[6]。實際上可能只是沒創造力又需要維持大腦袋的生物都死光了,但我們很難證明或排除這種可能性,因為我們很難推論已滅絕的生物有多少創造力。

科學講求實證,但如果我們能收集到的資料本來就已經存在偏誤時,那就很難得出正確的結論。

最後我要提一個對撞變因直接影響科學界的例子:如果想要將研究結果發表在好的科學期刊上,通常有兩個標準:研究本身很嚴謹、研究結論很引人注目。這表示當我們看任何期刊上的研究,就發現結果越特別的研究,平均來說越不嚴謹。因為如果研究方法很爛還能發到好期刊上,那肯定是結論很引人注目。


參考資料:
1. Moutafi J, Furnham A, Paltiel L (2004) Why is Conscientiousness negatively correlated with intelligence? Personality and Individual Differences 37(5):1013-1022
2. Asendorpf JB, Rindermann H, Woodley MA, Stratford J, Rabaglia C, Marcus G, Lane S (2012) Bias due to controlling a collider: A potentially important issue for personality research. European Journal of Personality 26:391-413.
3.  Corbett C, Hill C (2012) Graduating to a Pay Gap: The Earnings of Women and Men One Year after College Graduation. American Association of University Women.
4. Wakabayashi D (2017-09-08) At Google, Employee-Led Effort Finds Men Are Paid More Than Women. The New York Times
5.  Silberzahn R, Uhlmann EL, Martin DP, et al. (2018). Many Analysts, One Data Set: Making Transparent How Variations in Analytic Choices Affect Results. Advances in Methods and Practices in Psychological Science 1(3):337–356.
6. Overington SE, Morand-Ferron J, Boogert NJ, Lefebvre L (2009) Technical innovations drive the relationship between innovativeness and residual brain size in birds. Animal Behaviour 78(4):1001-1010

2011-05-18

無所不在的統計,無所適從的大眾

  食物包裝上寫「內容量100±10克」,是說絕對不會出現一包89克的嗎?機車車禍造成的死亡中,有99%的人都戴安全帽,是表示安全帽很危險嗎?樂透已經連續三期開出29號,下次還是開出29號的機率會比較高或低嗎?民調輸0.001%是不是也算輸?當信心水準在±3%時,兩人的民調差異大於3%就是真的顯著嗎?還是要6%才算?

  以上問題只要有任一題你回答「是」,就表示你的統計觀念有錯。而我有十足的信心,讀這篇文章的人有超過95%的人會如此。一般人對統計的了解大概就只有降雨率高表示要帶傘、看到考試成績呈M型分佈時知道這樣不好、還有剛考完學測的人可能記得迴歸係數的算法。僅此而已,這完全不夠。

  要理解任何調查結果,至少要有的觀念包括抽樣方法、統計誤差、顯著水準等等。我們現在的教育在小學只有控制變因,國中只有機率,高中念理組也只算到排列組合、標準差和簡單迴歸,甚至到大學都不見得足夠(開頭那六題的最後兩題我就沒在大學的統計中學到)。這是非常嚴重的問題。

  統計是一種很容易被拿來濫用的工具,我們也時常可以看見每個人各憑自己的立場去解讀數據,由同樣的數據推導出完全相反的結論。當然,面對諸如石化廠的興建、候選人的提名、或是限水的施行方式這類重大的議題時,保持客觀的分析是非常困難的,但這不能用來當作濫用統計的藉口,因為錯誤的預測將會賠上我們每個人在現在和未來的生活。

  要解決這個問題,由專家替我們將數據分析成結論或許是一個可行的方法(我一直在想為什麼民調不能改成公佈候選人之間顯著差異的p值),但是因為專家也可能有自己的立場,而且人類總是不願意相信別人替自己做的決定,所以最根本的解決之道,還是要從教育著手。高等教育的宗旨曾經是要研究連續性的科學模型,但是隨著科技的進步和資訊的氾濫,資料分析已經成了更重要的目標。與其花費大量的時間在高中學習虛數、三角函數和微績分,我們更需要的是統計學。


2009-09-08

比賽分組

  許多人對數學課本最深的印象就是上面有守守、創創、不化蟲和不惑仙的漫畫,不過我還記得另一件事情:高三數甲課本宣稱扣除掉身高的影響(將成績除以身高)後,女生其實跑得比男生快。我一直對這個宣稱感到疑惑,如果可以除掉身高的影響,那何不也除掉體重的影響、除掉肌肉的強度、除掉血液循環的效率、除掉乳酸堆積的速度、除掉教練的水準、除掉成長環境、除掉基因、除掉意志力、除掉起跑的反應速度……這樣跑得比較快地人才是「真的」跑比較快嘛!所以就像拳擊有依照體重分組,以後所有的比賽都要依據上述所有的因子來分組,才會看到最公平的比賽,對嗎?

  不對。從決定論的角度來看,我們在看任何體育競賽,其實就是在看選手的各個特質的集合。就是源自教練的指導、先天的體質、戰術經驗與智巧、壓力承受等等,我們才能在場上看到台內球的千變萬化、弧圈球的電光石火、發球的以假亂真、腳步的行履如飛、放高球的不偏不倚、掃大板的倏乎即逝。如果真的除掉這些影響,那實際上的結果會變成每個人的表現都一樣,不會有任何因素來造成任何差異。就如一樣形狀大小的物體一起自相同地點落下,會同時落地。

  很多競賽之所以要根據一些條件分組,其實是因為那個因素對於選手的程度有相當大的影響力,而觀賞競賽的時候我們希望兩邊的程度相當,這樣觀眾才會覺得精采。也因此像西洋棋比賽雖然常用年齡分組,但是如果你不怕剛走幾步就被將死,通常兒童組是可以越級挑戰成人組的。

2008-04-25

相似度

媒體用「相似度」這個名詞行之有年,大家似乎還是不覺得有任何問題。每當媒體說兩人「相似度有X%」時,其實就是在欺騙觀眾。媒體沒有用電腦計算五官相對位置,沒有分析臉型,沒有比對面孔的三維座標;從頭到尾就只是記者自己評心情打分數,主觀地「感覺」兩個人長得有多像。但是媒體卻用量化的數據來比較兩個可以分析的樣品,煞有介事地用百分比來說兩人的外貌近似程度,好像很客觀一樣很科學一樣。

像不像你只要拿兩張角度光線相像的照片擺在螢幕上,大家自己會看,用不著讓一個記者的主觀判斷來影響觀眾,讓觀眾先入為主地覺得兩人像或不像。