關於 LLM
目前的人工智慧(AI)主流是基於類神經網路的大型語言模型(LLM)。簡單來講,LLM 以人類語言資料作為資料集,透過以機率預測下一個詞元(token)的預訓練,讓模型能掌握人類的語言規律、世界知識與基本邏輯。指令微調、人類回饋強化學習(RLHF)等後訓練,則讓 LLM 開始能進行一般對話,甚至解決人類的問題。
對 LLM 來說,token 能轉化為向量,於是一句話能被置入一個高達數千到上萬維度的向量空間中,這讓模型能辨識出文字不同、但語意相近的詞或句子,並將其定位在向量空間裡緊鄰的坐標。而在生成文章時,模型就是在進行一場基於統計的文字接龍,我們可以將其簡化,比喻為登山:文字接龍的每一步都是一個岔路口,模型會依據語境當下的機率(並透過溫度參數調整隨機性),通常會選擇最多人走過、腳印最深的那條路徑(溫度調高,走到小路的機率就變大)。
這種機率的本質讓 LLM 經常用最可能出現的 token 來產生句子,後訓練又讓它學會迎合訓練員偏好的寫法,兩相加成便導致句子的多樣性下降,產生所謂的「AI 腔」——句子的意思沒有錯,但用來描述的詞彙(其實)、句型(不是……而是……)、結構(三項排比)卻幾乎一樣。這以人類的說法叫做「句型過於單一」或「陳腔濫調」,國小國文課的「換句話說」練習正是在訓練我們不要老用同一種句型來說話,只不過目前的 LLM 需要使用者進一步要求,才能避開一部分這種情況。
類神經網路的運作方式也帶來一些局限,包括難以解釋與難以控制,具體來說,由於我們只能零星追溯高維向量在千億參數中到底是怎麼做權衡與計算(即黑盒子問題),再加上後訓練階段多半會獎勵模型猜答案,較少獎勵模型說出「我不知道」,所以一遇到知識盲區或高不確定性的問題,模型就習慣吐出一個字或猜一個答案。這導致當模型在缺乏事實約束的情況下會強行填補,表現出類似人類虛談(confabulation)的幻覺或答非所問的情形。也正因為這種運作機制不透明,當模型給出錯誤答案、或一本正經胡說八道時,我們很難像除錯程式一樣找出邏輯斷點。
但不管怎麼說,LLM 畢竟是由人類語言資料訓練而成,所以在語言方面有極強的能力,已經能夠輸出流暢的句子,在翻譯不同語種方面也有不錯的效果,至於程式語言這種語法形式化、結果可驗證的類別,更成為當今 AI 巨頭主要的商業戰場之一。
AI 對於創作
AI 降低了創作門檻,這是無庸置疑的事,不管是文字、圖像、音樂,甚至程式,任何新手都能盡情發揮創意,讓 AI 產出有相當水準的作品。然而,這也引發許多值得討論的議題,例如人類主動的意圖與創意具有何種意義、專業的價值、品味的建立等。
從編輯或讀者的角度來看,我更看重內容的價值,也就是說,只要文章言之有理、能傳達作者的見解,原則上就判定該內容可接受,底線則是作者能負責。所謂負責,在於作者能否交代每一個論點的來源、推論的邏輯,並保證內容屬實。
AI 很好用沒錯,但用法可能不是你想的那樣。比較擬真的做法是把 AI 當成一個懂很多、卻不懂你想做什麼的超強助理,它的表現理論上會隨著你交辦任務的品質提升而變好。首先是「上下文」(context),前面提過 AI 會透過機率預測字詞,而使用者提供的上下文會大幅影響機率分布,就像是使用者決定從哪個登山口出發。有了上下文,AI 的產出才有可能從所有人的平均標準,提升到你心目中的答案——當任務交辦得愈清楚,這個超強助理愈知道該怎麼做。接下來以一個思想實驗作為範例。
有三個人與 AI 協作,試著寫出一篇文章。甲用的提示詞很簡單:「請以 AI 文很容易辨識為題目,給我一千字的文章。」乙用的提示詞則是:「我想寫一篇關於 AI 文如何辨識的文章,請先與我討論,再幫我規劃步驟,並列出值得討論的題目。可能的話,上網搜尋這半年左右的討論,列出各方的意見,與相關的辨識技巧。」丙則是自己寫初稿,只請 AI 幫忙挑毛病與查證。
一般情況下,這三個人對作品的態度是丙比乙負責,乙又比甲負責。甲放棄所有責任,將思考與生成全部外包;乙雖然有提供資訊與框架,但論述與判斷卻是交給模型處理,只負了一半的責任;丙是自己制定結構與論述觀點,僅讓 AI 審閱,承擔完整的創作責任。儘管負責不代表寫得好,但丙至少能知道問題出在哪裡。
三者的主要區別在於交出多少思考主導權,提示詞工程的技巧倒是其次,至於作品的品質,則取決於思考、知識、判斷與表達能力。
創作必須持續思考、反覆取捨。例如唐代詩人賈島在寫詩時,為了選用「推」或「敲」而苦思許久,或是作家王文興精讀慢寫在文字語言上的創新,都是經過深度思考、反覆琢磨的判斷。這些判斷既是一種美學堅持,也是文學的價值之一。儘管 AI 能一次給出一堆替代方案,大幅降低產生選項的成本,但決定要用哪一個字的責任並沒有消失,創作的價值更依賴核心概念與最後的取捨,於是品味與美學的判斷便成為創作者最難被取代的環節。
況且,與 AI 協作時,如果使用者投入的思考不多,產出結果的含金量往往也不高,以寫文章為例,假如使用者只提供很簡單的概念,作為基礎的資料根本撐不起長篇大論時,AI 就只能將同一個概念換句話說來充數,出現「鬼打牆」的情況。
語言會互相影響,人與 AI 也是如此。當使用者經常與 AI 溝通、甚至向 AI 學習知識時,寫作習慣也有可能逐漸「AI 化」,已有研究指出 ChatGPT 出現後,英文學術論文裡 delve 這類詞彙的使用量明顯上升。一旦表達方式跟著固化、減少多樣性,文字的豐富度與美感也會衰減,而這一點對使用人口較少的語系會造成更大的衝擊。例如中文網路語料有簡繁體比例失衡的問題,以至於 AI 的輸出經常出現「默認、落地」等詞彙與翻譯腔,臺灣的使用者若長期接觸卻不自知,寫作習慣便會跟著改變,進一步降低語言的多樣性。
耐人尋味的是,從我的編輯經驗來看,「你在意的事,別人不一定在意」,並不是每個人都在意文字句構等細節。一旦有足夠多的人選擇「甲」的路徑(追求快速、省時、依賴直覺提示詞)來創作,整體社群就很難避免大量的模板作品出現。這些架構、用字趨同的作品看多了,便令人心生排斥。
AI 時代的品味與判斷力
AI 降低創作門檻使得世面上的創作總量大爆發,大眾對於成品的評判標準則有兩個可能的發展方向。
一個方向是標準下降。如果社群平台的演算法、大眾只關注點擊率、瀏覽量、效率,耳濡目染卻又毫無警覺,最終就是讓創作者回應市場需求,捨棄無人問津的手作感與深度,專注於立即的流量回報,使得這些與 AI 協作的作品風格趨於平均,造成創作的多樣性降低——有趣的是,這種非主流表達逐漸消失的現象不利於 AI
模型後續的訓練。當 AI 從網路上開始學習自己或彼此產出的同質化資料時,有可能產生「模型崩潰現象」(model collapse),導致統計分布的尾段消失,輸出愈來愈單調。
另一個方向是標準提高。文字敏銳度高、經常接觸 AI 作品的讀者,很容易就能直接判斷出哪些文章可能有 AI 介入(之所以說「可能」,是因為無法百分之百斷定);當這些人整理出常見的 AI 腔時,一方面提高其他人的認知與素養,另一方面也讓這些資料有機會再導入 AI(例如寫成給 AI 遵守的寫作規範),形成系統上的軍備競賽。不過,即使寫作規範能減少 AI 腔,卻無法避免平庸,品味仍是作品優劣的關鍵。
又或是隨著 AI 產出的內容愈來愈流暢、制式化時,大眾或創作者可能會對四平八穩的產出物產生審美疲勞,從而出現另一種趨勢,反而更珍視帶有強烈個人主觀視角、粗糙不完美的手作感,以及真實的生命經驗。
所以,無論是哪個領域,創作者與讀者/觀眾都應該大量接觸多元、非公式化的人類真實創作、跨界學習、強化自身知識素養,一方面藉此提升自己對事物的品味,另一方面在與 AI 協作、或看待 AI 作品時,才有足夠的能力可判斷好壞與真假。
人類沒有因為電腦在棋盤上勝過人類之後而停止下棋,反而順著這樣的發展加速學習,並開拓出更深的認識。而在棋局裡,當所有人都有固定的開局模式,新的致勝策略便會隨之誕生。AI 也是如此,當 AI 愈能替我們產出大量選項時,人類就愈該把價值放回「選擇」。
好比本文在寫作時,使用各家 AI 協助糾錯,但每家給的建議都不同,有的認為思想實驗需要補上「丙」,有的則建議在「乙」多做說明,考量到自己採取丙的做法,便加以採納。無論工具多強大、能提供多少選項,做出選擇的必須是人;要選擇哪個方向、要怎麼取捨這些建議,最終還是回到該為文章負責的我。
注一:本文從 2026-09-20 開始寫作,2026-10-07 發布。花了十八天才寫出這些文字,我果然不適合寫作 lol
注二:中文與英文之間的空格是「為了方便 AI 讀取」才刻意加上去的,理由很簡單:現在網路上的機器人與 AI 爬蟲比人多。
沒有留言:
張貼留言