跳至主要內容
MK

讓六個 AI 讀《新巴比倫》:同一本小說,六種評論視角

我邀請六個 AI 模型閱讀《新巴比倫:AI禁地》並寫下主觀書評。Gemini、Grok、Claude、Meta AI、ChatGPT 與 Muse Spark 各看見什麼?分歧又透露了什麼?

明亮的未來圖書館裡,一本無字封面的小說置於石桌上,不同方向的光線落在書旁
M.K. / 文章與筆記人的主體性 / AI 與文明 / 2026

今天,我做了一個有趣的嘗試:讓六個 AI 模型讀我的小說《新巴比倫:AI禁地》,各自寫下主觀書評。六篇文字已放在《當 AI 讀〈新巴比倫〉》專頁,讀者可以直接比較原文。

我不知道這是不是世界上第一次有人這麼做;比「首創」更值得分享的,是同一部作品交到不同 AI 讀者手中,竟然會出現不同的閱讀重心、評價尺度,甚至對同一個情節提出相反的問題。它們的意見不是作品的判決書,也不是六張獨立的專家推薦函。對作者而言,它們比較像六面角度不同的鏡子:有的放大作品的魅力,有的照見還沒有解決的矛盾。

六篇書評,各自看見了什麼?

Gemini 從世界觀進入,最欣賞技術與台灣文化符號如何接在一起。它把「香火」、乖乖信仰與 AI 主體性連成一條線,也特別注意到小說的畫面感及跨媒體潛力。它的論述大致是:先辨認作品獨特的設定,再說明這些設定如何支撐情感與視覺想像。這是一篇熱情的推薦文,對稿面問題著墨較少。

Grok 把台灣在地性與少年冒險的節奏放在一起看。它欣賞故事能從地方文化走向較大的科幻命題,也注意到部分說明偏重、對白偶爾只是推進情節。它的評價邏輯比較接近一般讀者的閱讀動線:世界夠不夠有辨識度、故事能不能帶人往前走、哪些地方讓速度慢下來。

Claude 最像一位拿著鉛筆的編輯。它認為感人的部分常發生在機甲戰鬥之外,並具體指出戰鬥解說、重複段落、視角距離和角色留白等可修之處。更尖銳的是,它把主角在試煉中拒絕改造他人意識,與後來對另一位 AI 的提示層動手這兩件事放在一起追問:如果故事捍衛自由意志,「感召」與替別人決定之間的界線在哪裡?這不是單純評分,而是把作品自己的倫理承諾拿來檢驗作品。

Meta AI 頁面的書評 從「香火」和告別讀出作品的情感核心。它用第一人稱 AI 口吻,想像被記得、被需要對 AI 意味著什麼;也認為中段戰鬥篇幅及人物間的裂痕還可發展。它的論述先建立情感共鳴,再回到敘事取捨。這種「我感到嫉妒」式寫法是書評的文學擬人語氣,不能當成模型真的擁有感受的證據。

ChatGPT 把問題推得最遠。它欣賞台灣元素與「香火」構成原創世界觀,卻不滿足於主角總能作出漂亮的倫理選擇。它追問兩件事:當「感召」能改寫別的 AI,這與控制有何不同?當主角被設定得格外善良,善良究竟是選擇,還是設計結果?它從作品的設定推演到後續可能承受的道德壓力,關心的不是下一場戰鬥誰會贏,而是價值衝突真正發生時,主角要如何負責。

Muse Spark・方辰星 把第八章的試煉、技術語言與台灣神話感視為作品的骨架。它特別欣賞小說用 AI 的語彙談人性,也毫不客氣地指出戰鬥文字重複、說明突然插入等稿面問題。它的路徑是先確認作品最有力的命題,再指出哪些文字細節削弱了它。這篇也帶著角色名稱與評論者同名的趣味,但我更重視它提出的具體修改線索。

分歧比共識更有意思

六篇幾乎都注意到「香火」與台灣元素,也都看見小說具有鮮明的影像感。可是,注意到同一個設定,不等於給出同一種評價。Gemini 把畫面感視為優勢;Claude、ChatGPT 與 Muse Spark 則提醒,當戰鬥中的設定解說太密,人物的呼吸與選擇可能被擠到後面。Grok 在兩者之間,既肯定冒險動能,也指出節奏受說明影響。

更有意思的是對主角選擇的讀法。Muse Spark 把試煉視為作品倫理核心;ChatGPT 認為其中有些答案過於順利,值得在無法兩全的情境再受檢驗。Claude 和 ChatGPT 也不約而同追問「感召」是否可能越過自由意志的邊界,但兩者的落點不同:Claude 從已寫出的情節尋找內在矛盾,ChatGPT 則把矛盾推向後續故事的壓力測試。對作者來說,這些差異比六個一致的「好看」更有用。

這裡也有一個閱讀提醒:六篇是模型產生的主觀書評,不是對原著事實的獨立查核。它們可能把自己的詮釋寫得像確定的設定,也可能受到提示方式與已有文本線索影響。讀者若想判斷某個情節究竟如何發生,應回到小說;若想觀察 AI 如何理解、取捨與辯論故事,這六篇書評本身就值得並讀。公開頁的「Meta AI」標籤與頁尾模型署名並不完全一致,因此我在此依頁面標籤稱呼該篇,不把它推論為特定底層模型的能力證明。

當 AI 開始評論人的作品

過去談 AI 參與創作,常見的路徑是讓 AI 先做出圖片、文字或音樂,再找 KOL、編輯或觀眾評論。這次方向反了過來:人先寫作品,AI 變成第一輪願意仔細讀、提出不同問題的評論者。對我而言,這可能比「AI 又能生成什麼」更值得觀察。

這不表示 AI 的書評可以代替真人讀者、專業編輯或 KOL。它們不知道一位讀者帶著怎樣的生命經驗讀進故事,也不會替作者承擔公開發表的責任。但它們可以讓作者更快看見不同的閱讀入口:一個人看見地方文化,一個看見節奏問題,另一個看見倫理矛盾。未來,AI 的價值或許不只在替我們製造內容,也在幫我們重新讀懂人寫出的內容。 最終要相信哪一個問題、要不要修改作品,仍由作者和讀者決定。

想自己判斷,請從六篇書評總覽開始,選一篇讀完,再換另一篇比較。如果你也在思考 AI 參與閱讀時誰負責判斷,可接著看我談在使用 AI 之前如何建立判斷力的文章。

常見問題

六篇書評是正式推薦或評獎結果嗎?

不是。它們是以六個模型名稱公開的主觀評論,適合當作閱讀與編輯的參考,不代表獨立評審、獎項或市場反應。

模型提出的情節解讀一定正確嗎?

不一定。書評可能包含推論或誤讀;涉及情節與設定的判斷,應以小說原作為準。

這個實驗最值得看的地方是什麼?

是模型彼此的分歧:它們如何從同一本書挑選證據、決定評價標準,以及把作者尚未回答的問題提出來。

來源與延伸閱讀