美國研究分析 6萬多篇 AI 與人類的小說,光靠敘事結構就能分辨人類與 AI寫得文章,
準確率高達 93.2%,改寫文字風格後只降了 1.6 個百分點。
這個替判斷 SEO 文章是否由 AI 生成提供了新的檢查角度,
適合內容編輯與 SEO 團隊在稿件審查、內容健檢時參考使用。

AI 生成的小說事件,正在真實發生
2026 年 3 月,TechCrunch 報導:Hachette 撤回 Shy Girl 一書,
Hachette 因恐怖小說《Shy Girl》爆出大量使用 AI 創作的疑慮,停止在英國出版的版本,並取消原訂推出的美國版。
外部 AI 偵測結果指出,書中最高約 78% 的內容可能由 AI 生成。

AI小說《Shy Girl》
同期另一項調查更驚人:
Stony Brook University 電腦科學教授 Tuhin Chakrabarty 主導的團隊,
用 AI 偵測工具 Pangram 檢查了 Amazon 上超過 14,000 本自行出版小說,將近 20% 被判定含有大量 AI 生成內容;
在該調查比較的 2024~2025 年樣本中,這類作品數量增加約 41%。
為什麼「找 AI 味用詞」卻來越不準了?
當作者不主動揭露 AI 使用時,要怎麼判斷一篇文章、一本書是不是 AI 寫的?
這個問題,也是我們在幫客戶檢視網站內容時,愈來愈常被問到的問題。
多數人做 AI 文章偵測的直覺,是去找「AI 味」的用詞,
破折號用太多、愛講「深入探討」、「總的來說」、「老實說」、「簡單來說」等,
但這已經不太準確了,因為GPT-5.4 已經大幅減少破折號使用,
而只要針對人類寫作風格做微調,創意寫作的 AI 偵測率可以從 97% 直接掉到 3%。
寫作風格是最容易偽裝的部分,真正該問的是:
有沒有更深層、更難模仿的 AI 寫作特徵?
單靠用詞比對,很快就會被新版模型或風格微調繞過去。
StoryScope:換一個角度問問題
如果完全不看用詞和句法,只看故事「怎麼構思」,AI 和人類寫的東西分得出來嗎?
美國馬里蘭大學與 Google DeepMind 研究員 John Wieting 合作的論文《StoryScope: Investigating idiosyncrasies in AI fiction》(COLM 2026,arXiv:2604.03136)換了個角度提問。
研究人員把重點從表面文字的風格,轉向故事在構思層面的結構性選擇:
比如情節怎麼安排、旁白怎麼收尾、情緒怎麼表達。

研究方法:61,608 篇故事、5 個模型、304 項特徵
研究團隊先從 Books3 取出 10,272 篇人類短篇故事,再利用 Gemini 2.5 Flash 反推出每篇故事的核心寫作提示,
接著讓 Claude Sonnet 4.6、GPT-5.4、Gemini 3 Flash、DeepSeek V3.2、Kimi K2.5 根據同一提示各寫一版,
總共 61,608 篇、平均近 5,000 字的故事。
接著用 LLM 把每篇故事轉成結構化的敘事表示,再建立橫跨 10 個維度的 304 項特徵。
研究人員進一步排除風格相關訊號,只使用 257 項敘事特徵進行分類,測試光靠故事結構能不能分辨人類與 AI。
研究結果:光靠敘事結構就能分辨 93.2%
macro-F1 是分類模型常用的綜合評估指標,會同時考慮 precision 與 recall,並平均計算各類別表現。結果顯示,光靠敘事結構,分辨人類與 AI 的 macro-F1 就有 93.2%,
達到「含風格特徵模型」(96.0%)表現的 97% 以上;
只用其中最核心的 30 個特徵,macro-F1 也還有 84.8%。
更關鍵的是,研究團隊用另一個工具把 AI 故事的表面寫作風格(陳腔濫調、浮誇修辭)整段改寫掉,再重新偵測,
分類表現只從 95.5% macro-F1 降到 93.9%,下降 1.6 個百分點。
這些結構性訊號,不是換幾個字就會消失的。
不過要說清楚,StoryScope 並不是目前準確率最高的 AI 偵測器。
論文裡的 ModernBERT、TF-IDF/Stylometry 等純文字分類基準甚至可達 99% 以上;
StoryScope 的價值不在追求最高辨識分數,而在於它提供一組可解釋的敘事層級特徵,能進一步觀察到哪些敘事可以讓人類與 AI 在統計上出現差異。
AI 寫作特徵:人類 vs AI 到底差別在哪裡
研究團隊把最穩定的訊號濃縮成 30 個核心特徵。
以下挑出幾個差異特別明顯、也比較容易理解的例子,方向都指向同一件事:
AI 把故事收拾得太整齊,人類則留了更多沒收乾淨的地方:
| 特徵 | AI | 人類 |
|---|---|---|
| 旁白直接講出主旨/寓意 | 77% 高 | 52% 低 |
| 對話拿來講人生哲理 | 59% 高 | 34% 低 |
| 故事沒有支線(單線敘事) | 79% 高 | 57% 低 |
| 由主角自己行動解決 | 69% 高 | 46% 低 |
| 靠「內在理解/接受」收尾 | 47% 高 | 27% 低 |
| 情緒靠身體感覺表達(如「胸口一緊」) | 81% 高 | 38% 低 |
| 用嗅覺意象描寫 | 82% 高 | 57% 低 |
| 直接寫出情緒詞(如「他很害怕」) | 8% 低 | 29% 高 |
| 打破第四面牆 | 39% 低 | 67% 高 |
| 直接對讀者說話 | 7% 低 | 28% 高 |
| 具名引用真實作品/人物 | 24% 低 | 47% 高 |
兩組實例對照:AI 傾向 vs 人類傾向
舉兩個對照的例子最容易感受差異。
同樣要交代「他終於想通了」:
- AI 傾向:「他終於明白,真正重要的並不是成功,而是陪伴。」——故事演完了,還怕讀者沒看懂,再講一次。
- 人類傾向:讓行動本身說話,不補一句畫重點的旁白,是否想通留給讀者自己判斷。
同樣要交代情緒:
- AI 傾向:「一股寒意沿著背脊爬上來,她感覺胃沉了下去。」
- 人類傾向:「她很害怕。」——直接、不繞路。
像「胸口一緊」這類寫法過去常被當成文學性較高的證據,
但因為五個模型不約而同大量使用這套 show-don't-tell 公式,
反而變成統計上最明顯的 AI 特徵之一。

情節安排、模型指紋與特徵距離
情節安排上的落差更直接。
AI 傾向一條線走到底:
沒有支線(79% vs. 人類 57%)、
由主角自己行動解決(69% vs. 46%)、
靠「內心理解/接受自己」收尾(47% vs. 27%)。
人類則比較常把事情搞複雜,插敘、倒敘、跳時間、埋一條沒完全收掉的支線,
甚至讓角色做出不合理的決定,結局也不一定給答案。
論文裡舉了一個很生動的對照:
同一個推理故事,人類版本可能「從葬禮開場,再往前倒轉二十年」;
AI 版本則傾向「從第一條線索開始,一路直線推進到真相大白」。
論文原句寫:human stories are messier,人類的故事比較「亂」,
但這種亂指的是人類不會每次都選最安全、最好懂的那條敘事路線。
五個 AI 模型還各自帶有自己的敘事指紋。
研究團隊另外找出一批 per-model fingerprint features,描述不同模型特別偏好的敘事選擇:
Claude 的事件張力全場最平緩、偏好加寫後記、幾乎不寫夢境橋段;
GPT 特別愛用八卦與流言推動劇情(64% vs. 其他模型 44%~55%);
Gemini 結局最工整、鋪陳最長,場景氣氛也最陰鬱(88% 被標為壓抑陰暗);
DeepSeek 習慣把關鍵背景資訊提早交代;
Kimi 的指紋最少,落在 AI 分布裡最典型、最沒有個性的中央位置。

指紋歸指紋,把人類加上 5 個 AI 放在一起做六分類,難度明顯比二分類高得多:
只用 30 個核心特徵,macro-F1 只有 46.5%;
加入模型指紋後提高到 63.4%;
用完整的 257 項敘事特徵可達 68.4%(亂猜基準只有 16.7%);
再加回風格特徵,最高來到 77.3%。
不同模型之間存在可辨識差異,但不如「人類 vs AI」那道界線清楚:
在分類結果裡,Gemini、DeepSeek、Kimi 特別容易彼此混淆,形成一個界線較模糊的 AI 群。
特徵空間裡的距離更能說明這件事:
人類作品和 AI 作品的平均 centroid 距離是 6.6,五個 AI 彼此之間的平均距離卻只有 4.3;
就算挑出「跟人類最接近的 AI」和「彼此差最多的兩個 AI」相比,
前者的距離(6.2)依然大於後者(6.0)。
不同公司的 AI,彼此之間反而比任何一個 AI 與人類更接近。
人類作品本身也分布得更廣、更「罕見」:
人類故事的平均 rarity percentile 為 0.71,
AI 為 0.49;
24.7% 的人類故事落在全資料集最罕見的前 10%,AI 只有 7.1%;
同一題材的六個版本互相比較,人類版本有 57.8% 的機率是其中最罕見的一篇(純亂猜基準只有 16.7%)。
浮水印能解決這個問題嗎?
另一條常被提到,是讓 AI 模型自己在生成時「留記號」,
例如 Google DeepMind 的 SynthID-Text(Nature, 2024)會在生成文字裡嵌入統計層級的浮水印,
不影響閱讀體驗,偵測準確率也很高。
這個做法有個前提:
必須是生成模型自己配合埋入浮水印。
換一家沒有配合的模型、或用開源模型批次產文,浮水印就完全派不上用場。
StoryScope 的路線不需要模型端配合,只要拿到最終故事文本,
就能分析其敘事結構,不管是哪個模型生成的。
至於能不能同樣用於一般論說文、SEO 或網站文章,論文本身沒有做這個實驗,目前還沒有證據支持。
兩者不互斥,比較務實的組合是:
能拿到浮水印資訊就優先用浮水印,拿不到時退回結構分析當次要判準。
對網站內容與 SEO 文章的啟示
StoryScope 分析的是5000字上下的短篇小說,取材自 Books3 語料庫,
驗證方式也是文學層面的敘事理論(NarraBench),不是行銷文案或服務頁。
但它提出了一個延伸驗證的方向:
比起只看用詞,文章更高層次的結構可能保留更穩定的來源訊號。
這個現象能不能遷移到 SEO、GEO、論說文或中文內容,仍需要另外驗證,不要把它當成定論。
把這個原則套到一般網站內容上,可以觀察的結構訊號包括:
- 結論是不是講死了:
每一段是不是都用一句「總結來說」收尾,而不是讓案例、數據自己說話 - 建議是不是太乾淨:
有沒有承認例外、權衡取捨,還是任何情境都套用同一組「三個步驟」 - 有沒有具體指涉:
提到的是「某研究顯示」還是真的點名工具、客戶、數字、日期 - 多篇文章的結構是不是高度雷同:
同一種「開場、三點、結論」的骨架套在完全不同主題上
這些也是我們在幫客戶做內容審查時,
除了看用詞、看 E-E-A-T 訊號之外,現在會額外檢查的一層:
表面寫作風格很容易隨模型版本、改寫方式而改變;
至少在 StoryScope 的長篇英文小說實驗裡,敘事結構留下的訊號比寫作風格更耐改寫。
舉個例子,同樣是寫一篇「中小企業該不該做在地 SEO」的文章,結尾常會出現這兩種寫法:
- AI 傾向:「總結來說,在地 SEO 能有效提升曝光度與轉換率,是中小企業不可或缺的行銷策略。」
- 人類傾向:「我們接過的案子裡,在地 SEO 對餐飲業效果很快,但對 B2B 軟體公司幾乎沒用,後者的客戶根本不在 Google 地圖上找人。」
前者是結論講死、放諸四海皆準;後者留了具體案例、也承認了例外。

StoryScope 真正證明的是:
在長篇英文小說裡,表面風格被改寫掉之後,敘事結構依然保留很強的來源訊號。
這套方法能不能直接拿來判斷 SEO、GEO 或中文網站文章,目前還沒有實驗證據支持,我們也不會這樣宣稱。
但對內容製作來說,它至少提醒了一件事:
與其只盯著「AI 愛用哪些字」,更值得檢查的是文章是不是每次都用同一套邏輯、同一種結論、同一個最安全的答案收尾。
如果你也想替網站文章做一次結構層級的內容健檢,益盛科技的 SEO/GEO 服務可以協助檢視內容結構與品質,歡迎與我們聊聊你的需求。
也歡迎到益盛科技部落格看更多 SEO、GEO 與內容經營相關文章。

