vatt'ghern jaskier's ballads
本文 1 個互動圖表在手機上以重點摘要呈現,互動版請以桌面瀏覽器開啟。

「同一支偵測器、同一個門檻,量出來的『疑似 AI 代筆』比例,從電腦科學的 65% 一路掉到數學的 0.7%——這個 0.7% 到底代表『數學家很少用 AI』,還是代表『偵測器根本看不懂數學論文』?」

32% 的 arXiv 論文疑似 AI 代筆——但這個數字自己也會壞掉

份對 arXiv 論文做文字偵測的報告,最近在 unslop.run 上發布。研究團隊挑了十個領域組,每個領域每個月抽樣約 25 篇論文,從 2023 年 1 月一路採到 2026 年 7 月,另外再從 2021 到 2022 抽了八個控制月份,總共湊出 12,750 篇論文的樣本,逐篇跑過偵測器,記錄每篇論文的內文(不是摘要)有多像機器寫的。為了不讓訊號被稀釋,他們選擇整篇內文,不掃摘要——研究團隊自己就遇過同一篇論文摘要拿不到 20 分,內文卻超過 70 分的落差;每一篇論文也固定抓「第一版」PDF,避免 2026 年的修訂版文字,回頭污染了 2023 年那個時間格子的樣本。結論的頭條數字很好記:整體疑似 AI 代筆的比例落在 32% 左右,最高在 2026 年初一度衝上 39%,而 2021 到 2022 那批「前 ChatGPT」控制組,這個比例穩穩地卡在 0.4%。乍看是一個乾淨的故事——直到你把論文拆成領域來看,同一份報告裡冒出兩個互相矛盾的問題:一個數字漲到 65%,另一個數字幾乎不動,而作者自己承認,光看這兩個數字,沒辦法判斷後者是真的沒人用 AI,還是偵測器根本沒發現。報告本身沒有替讀者做這個拆解的決定——它把整張表格攤開,讓每個領域自己說話,這也是這篇文章接下來要做的事。

32%,而且沒有天花板

先把頭條數字放大看。偵測器的運作方式不是猜測「這篇論文讀起來像不像 AI」,而是先在一批已知是人類寫的文字上校準門檻——研究團隊把門檻設在「讓 2021 到 2022 年的論文剛好有 0.4% 會觸發」的位置,同一個門檻拿去測已知是 AI 寫的學術文字,抓到 85%。換句話說,這是一個統計操作點:門檻越嚴,誤判越少但漏抓越多;門檻越鬆,抓得越全但誤判也跟著爬升。這份報告選擇把誤判率釘死在 0.4%,然後接受 85% 的召回率,把這個門檻套用到 2023 年之後的論文上。

選 2021 到 2022 當控制組,理由很直接:那兩年 ChatGPT 還沒問世,論文裡不可能摻進大型語言模型代筆的痕跡。這批「乾淨」樣本,扮演的正是實驗裡的對照組角色——沒有它,後面所有跟 32% 的比較,都失去了基準線。

從這個門檻量出來的曲線,形狀很清楚:控制年份(2021 到 2022)平穩落在 0.4%,ChatGPT 問世後數月內開始起飛,接著分兩波爬升,來到近期完整季度的約 32%,2026 年初一度衝上約 39% 的高點。0.4% 到 32%,中間差了大約 80 倍——這不是一條慢慢爬升的曲線,是一條在特定時間點「起飛」的曲線。

抽樣規模本身也值得放進來看:十個領域、每個領域每月抽 25 篇,從 2023 年 1 月排到 2026 年 7 月,正好是 43 個月,再加上 2021 到 2022 那 8 個控制月份——換算下來,總數落在 12,750 篇這個量級,跟報告揭露的樣本數吻合。這代表每個領域組累積的樣本量,多半有一兩千篇上下,不是那種十幾篇論文就敢下結論的規模,這也是為什麼即使拆到十個領域,每個領域各自的信賴區間都還算收得住。

拖曳圓點看三個時間點的狀態 · 3 個節點

2021–22 控制年份 ChatGPT 之後 起飛 現在 32%/39%
分兩波爬升,近期完整季度來到約 32%,2026 年初一度衝上約 39%。

「兩波爬升」這個說法本身也值得多想一秒——如果真的只有一次性的採用衝擊,曲線該是一次起飛之後打平;分成兩波,比較像是先有一批人開始用,隔了一段時間,第二批工具或用法又把比例推高一次。報告沒有拆解每一波背後對應的是哪些新工具或新版本,合理的推測是,這條線接下來還會有第三波、第四波,而不是已經摸到頂了。

如果只看整體數字,故事已經很聳動:學術寫作裡,機器代筆從幾乎不存在,變成三分之一。但「32%」這個數字,其實是十個領域的平均值,而平均值最擅長的事情,就是把差異藏起來。

這套抽樣設計本身經得起檢驗:十個領域組、跨越三年半的月抽樣,加上獨立的前控制年份,讓「32%」不是一次性的快照,而是一條可以回頭對照基線的曲線。真正該懷疑的,從來不是整體數字算得準不準,而是拆開之後,每個領域各自站不站得住。

候選解釋一:數學論文真的很少用 AI

把整體數字拆開之後,領域之間的落差大到不像同一份報告:電腦科學 65.0%(95% 信賴區間 59.3% 到 70.3%),量化生物學 56.3%(51.0% 到 61.7%),一路往下到天文物理 10.7%(7.3% 到 14.3%),數學殿後,只有 0.7%(信賴區間 0.0% 到 1.7%)。第一個直覺的解釋很自然:數學家寫論文,本來就沒有太多空間讓語言模型代筆——證明步驟環環相扣,一個符號錯了整篇就垮,研究者對自己動筆的信任本來就比散文寫作高,AI 採用率低是合理的。

中間的六個領域,排出來是一條平滑的斜坡,不是斷崖:電機工程與系統 51.3%、經濟與金融 47.0%、應用物理 34.0%、統計學 31.3%、凝態物理 24.0%、高能物理 14.0%。從電腦科學到數學,比例幾乎是連續下降,沒有哪個領域忽然跳空——這種平滑的排序方式,比起「AI 只在少數領域出現」的劇本,更像是「AI 滲透的深淺,跟著這個領域的寫作本來有多接近散文」在走。

這個解釋有一部分證據撐腰。報告裡每個領域都附了自己的「控制年基準」——用 2021 到 2022 年、三種靈敏度設定平均出來的誤判率。數學這一欄是 0.0%,天文物理也是 0.0%,電腦科學是 0.2%,量化生物學則明顯偏高,落在 3.5%。如果偵測器對數學文字有系統性的誤判傾向,這個控制年基準應該會被拉高才對——但數字沒有被拉高,反而是十個領域裡最低的兩個之一。單看這一欄,「偵測器對數學文字亂抓」這個反方向的懷疑,至少在控制年的資料裡站不住腳。報告也提醒,這一欄的控制基準只是近似值,不是精確校準,讀的時候不能當成沒有誤差的定值。

量化生物學的控制年基準特別突出:3.5%,是全部十個領域裡最高的,比整體用來校準門檻的 0.4% 高了將近九倍。報告沒有解釋為什麼——但這個數字本身就是一個提醒:56.3% 的旗標比例裡,可能有比其他領域更大的一塊,其實是雜訊,而不是真的 AI 代筆。

點欄位標題排序 · 4 欄 × 10 列

領域 控制年基準 目前旗標比例 95% 信賴區間
電腦科學0.2%65.0%59.3%~70.3%
量化生物學3.5%56.3%51.0%~61.7%
電機工程與系統1.7%51.3%46.0%~57.0%
經濟與金融2.5%47.0%41.3%~52.7%
應用物理1.3%34.0%29.0%~39.7%
統計學1.8%31.3%26.0%~36.7%
凝態物理0.0%24.0%19.3%~29.0%
高能物理0.5%14.0%10.0%~18.0%
天文物理0.0%10.7%7.3%~14.3%
數學0.0%0.7%0.0%~1.7%

報告裡的每一個百分比,都附了 bootstrap 重抽樣算出來的 95% 信賴區間——不是單一個精確數字,而是一個範圍。這個範圍的寬窄,本身就是另一種提醒:樣本量越小、比例越極端,區間就拉得越開,讀表格的時候不能只看中間那個數字。

信賴區間的寬度,也藏著一個容易被忽略的細節:電腦科學的區間是 59.3% 到 70.3%,寬度約 11 個百分點;數學的區間是 0.0% 到 1.7%,寬度只有 1.7 個百分點。絕對寬度看起來數學比較窄,好像更精確——但相對於數學本身只有 0.7% 的基準值,1.7 個百分點的區間,等於真實值可能是報告數字的兩倍以上;電腦科學的 11 個百分點,相對於 65.0% 的基準,只是一個小幅度的擺動。同樣是「信賴區間」,在低分領域和高分領域,代表的確定程度完全不一樣。

但這個解釋只回答了一半的問題。控制年基準低,只能說「偵測器沒有把普通的數學論文錯認成 AI」,不能反過來說「偵測器能準確認出數學論文裡真正的 AI 代筆」。這兩件事分別對應偵測器的兩種錯誤——誤判率與召回率——而報告裡明講的 85% 召回率,是在「一般學術文字」上量出來的整體數字,並沒有針對數學論文單獨測過。

工程師熟悉的說法或許更直接:控制年基準對應的是分類器的假陽性率(false positive rate),量的是「明明沒有 AI,卻被抓到」的機率;召回率(recall)量的是「真的有 AI,能不能被抓到」的機率。同一個分類器,這兩個指標可以完全獨立地變差——一個領域的假陽性率很低,不代表它的召回率也一樣高。

候選解釋二:偵測器看不懂數學的寫法

第二個候選解釋,方向完全相反:數學論文的旗標比例低,不是因為沒人用 AI,是因為偵測器根本看不懂數學論文的寫法。報告裡對這點講得很直接——數學論文被公式與定理證明結構占滿,拿掉公式和引用之後,剩下的散文非常稀疏,跟偵測器訓練時看過的科學英文不一樣。用研究團隊自己的話講:一篇大量借助模型輔助寫成的數學論文,分數可能偏低,是因為它的散文對偵測器來說「分布外」(out of distribution)——所以數學論文拿到低分,只是「人類寫的」的薄弱證據,不是強證據。

這種偵測器,不管背後用的是困惑度還是文字風格特徵,本質上都需要足夠長、夠自然的連續散文,才找得到「這段文字讀起來像不像人話」的線索。數學論文一旦把公式、引理、證明步驟拿掉,剩下的過渡句往往只剩「因此」「由上式可得」這類極短的連接語——不管是人寫的還是代筆的,剩下的文字量本來就不夠偵測器施展。合理的推測是,這也是為什麼偵測器在其他公式密度高的領域,例如高能物理(14.0%)與凝態物理(24.0%),旗標比例同樣偏低,而不是這些領域真的比電腦科學更少人用 AI。

這個解釋的殺傷力在於,它直接動搖了候選解釋一賴以成立的基礎:控制年基準低,量到的是「偵測器沒有錯認一般數學論文」,但如果偵測器對數學文字的整體敏感度本來就偏低,那麼就算真的有研究者拿模型寫論文,偵測器也可能因為抓不到熟悉的散文特徵而放過。兩種解釋用的是同一組數字,卻指向完全相反的結論。

報告的「限制」一節還補了一刀:偵測器對不同的生成模型敏感度不一樣,而研究團隊也沒辦法拿到作者實際使用的模型與提示詞組合去逐一驗證。覆蓋不完整只會把旗標比例往下拉,不會往上推——這也是為什麼作者反覆強調,回報出來的比例是下限,不是精確值。

點按鈕切換兩個候選解釋 · 2 個假設

數學自己的 2021 到 2022 控制年基準是 0.0%——這一欄沒有被拉高,不像是偵測器普遍誤傷數學論文。
拿掉公式與引用之後,數學論文剩下的散文很稀疏,跟偵測器訓練時看過的科學英文不一樣——這是研究團隊自己承認的偵測器弱點。
兩個解釋在目前的資料裡沒辦法分開——這是報告作者自己的說法。

互動圖表

數學論文只有 0.7% 被判為 AI 代筆,可能是真的很少人用,也可能是偵測器讀不懂滿是符號的數學文本——這份資料無法分辨兩者。

報告的作者沒有迴避這個尷尬——他們自己寫下的結論是,這個結果同時符合兩種截然不同的解釋:採用率真的偏低,或者偵測器在這種文字風格裡敏感度下降,而現有的資料沒辦法把兩者分開。這句話值得慢慢讀:不是「我們傾向相信哪一種」,是「我們的方法論本身回答不了這個問題」。

哪些數字站得住,哪些數字會先崩

既然作者自己承認資料無法區分兩種解釋,這篇報告的 0.7% 到底還有沒有用?答案要看你怎麼用它。如果把它當成「數學界 AI 採用率的精確估計」,它站不住——因為它同時可能是「真實採用率」,也可能是「真實採用率除以一個未知、可能很低的偵測器敏感度」。但如果把它當成「至少有這麼多」的下限,它是站得住的:報告裡明講,回報的盛行率是一個下限,真實比例只會等於或高於量到的數字,不會更低。報告也明講,在低分領域裡,這種排名順序應該被讀成採用率的下限,不是精確值。

這個下限的可靠程度,其實跟數字本身的大小成正比。低分領域對「偵測器敏感度」這個未知變數非常敏感——如果偵測器在數學文字上的實際敏感度只有一般學術文字的一小部分,那麼 0.7% 背後對應的真實採用率,可以被放大好幾倍。但電腦科學的 65.0% 不一樣:就算偵測器對它的敏感度打了很大的折扣,換算回去的真實採用率也早就頂到上限——這個數字對「偵測器到底有多準」這個未知變數,幾乎不敏感。

這裡可以做一個簡單的換算:如果偵測器對某個領域文字的實際敏感度只有 s%,而觀察到的旗標比例是 p%,那麼背後真正的採用率,粗略估計就是 p 除以 s。s 等於 100% 代表偵測器完全不打折扣,觀察到的數字就是真實數字;s 越小,代表偵測器越常漏抓,同一個觀察值背後對應的真實採用率就要往上調整越多。報告本身量到的 85% 召回率,是所有學術文字的整體平均——沒有辦法保證每個領域各自的敏感度剛好等於這個平均值,數學論文的散文特徵跟平均值差最遠,這個假設也最不可靠。

拖曳滑桿看敏感度假設如何改變推算採用率 · 3 個領域

85%
0% 推算真實採用率 100% 電腦科學 76.5% 天文物理 12.6% 數學 0.8% 灰點=報告裡的原始旗標比例
拖曳滑桿等於假設「偵測器對這個領域的文字有多敏感」;65.0%、10.7%、0.7% 是報告裡的實際旗標比例,85% 是報告測得的整體召回率,但這份報告並沒有針對數學論文的散文單獨測過召回率——這正是作者承認資料無法回答的地方。彩色圓點=旗標比例除以假設敏感度、上限 100% 的推算值。

拿滑桿上的預設值 85% 當例子:電腦科學觀察到的 65.0%,除以 85%,推算出來的真實採用率是 76.5%;數學觀察到的 0.7%,除以同一個 85%,推算出來的真實採用率只有 0.8%。同一個敏感度假設,套在兩個領域上,答案差了將近一百倍——這正是「平均值 32%」這種說法最容易誤導人的地方:它假裝所有領域共用同一把尺,但實際上,每個領域的尺,可能連刻度單位都不一樣。

所以,同一份報告裡,數字之間的可信度並不平等。「32%」這個整體平均值,混合了幾個穩如磐石的高分領域,也混合了幾個一碰就碎的低分領域——把它們攤平成一個數字,反而讓讀者看不出哪個部分經得起檢驗。真正該問的問題,從來不是「這篇論文有多少比例是 AI 寫的」,而是「這個數字,是不是已經高到不管偵測器準不準都成立」。

還有一個提醒,跟工程師的日常判斷更貼近:報告作者自己講得很白,一個旗標不等於作者身分——偵測器估計的是「這段文字讀起來像不像機器寫的」,帶著已知誤差率的機率,沒辦法分辨一份文件是被輕度潤飾過,還是整篇由模型生成,單一分數也絕對不該拿來指控某一個具體的人。同樣的道理,也適用在任何一個「用分類器貼標籤」的場景——不管是抓 AI 寫的文章、抓 AI 生成的程式碼提交,還是抓自動化產生的垃圾內容。一個分類器在自己訓練分布內的表現,不能直接套用到分布外的輸入上;拿到一個異常低的比例時,先問它是不是剛好落在分類器視野的盲區,再決定要不要當成「乾淨」的證據。

如果只截取「32% 的 arXiv 論文疑似 AI 代筆」這一句話去做決策——不管是拿來當成審稿政策的依據,還是拿來評斷某個學門的學術風氣——都等於把十個差異巨大的領域,硬塞進同一個數字裡。真正對決策有用的,是那張拆開的表格,加上每個領域各自的控制年基準,而不是頭條那一個平均值。把整份報告放在一起看,「32%」比較像是入口,不是結論。真正決定這個報告有沒有用的,是讀者願不願意往下翻兩層——先看領域,再看每個領域自己的控制基準與信賴區間。大部分引用這類數字的討論,通常只停在第一層。

Take-away:下次看到偵測器量出來的低分比例,先別急著讀成「這裡很乾淨」——去找那個領域自己的控制年基準,再問一句:偵測器對這種文字風格,到底有沒有被單獨測過召回率。