CHECK 查證|AI 幻覺是什麼?每句都有道理,正是它最危險的地方

本文屬於《AI 時代的 20 個交接點》,本組:INTAKE 資訊品質 → 看整個系列

那份匿名的擔憂清單裡,排在第二名的是真假難辨,將近三成的人寫了這件事。多數人寫的是「假訊息」「難辨真偽」這種,但其中有兩句特別精確。

一句是「訊息錯誤,張冠李戴」。另一句是「太依賴,有錯誤也不清楚問題所在」。

第二句尤其值得停下來。它說的不是 AI 會出錯,那件事大家都知道。它說的是:錯了,但你不知道錯在哪。

重點速答

AI 幻覺不是胡說八道,是用真材料組出一句假話。人名是真的、機構是真的、年份是真的,只有組合方式是錯的。所以你逐項查都查得到,整句話卻不成立。AI 接走了「查得到答案」,所以「知道哪一句是它編的」變得更值錢。

幻覺最危險的地方,不在於它胡說八道

市面上提醒這件事的說法,大多是同一句話的變形:AI 會亂講,不可靠,要小心。這句話沒有錯,但它會害你抓不到重點。

因為亂講的東西其實不難認出來。一段語無倫次、前後矛盾、明顯離題的回答,任何人都會停下來。真正會被採信的,是那些寫得完整、語氣篤定、結構漂亮、每一句單獨看都合理的內容。

換句話說,幻覺不是雜訊,是結構完整的錯誤。它跟正確答案長得一模一樣,因為它就是用同一套材料、同一種語氣生出來的。

先界定這篇在談什麼

這篇談的是 AI 自己編出來的內容,不是別人拿 AI 去做的假訊息或假影片。那是另一個方向的題目,AI 生成的東西怎麼分辨那篇處理的是那一面。一個是它騙了你,一個是有人用它來騙你。

幻覺的真正形狀是張冠李戴,不是憑空捏造

那位學員寫下的「張冠李戴」四個字,比多數技術性的說明都準。

大多數人想像的幻覺,是 AI 憑空生出一個不存在的東西。實際上更常見的情況相反:材料幾乎全是真的,錯的是組合。真的人名,配上他沒說過的話。真的機構,配上它沒發表過的研究。真的年份,配上那一年沒發生的事。真的法條編號,配上不屬於它的內容。

這就是為什麼幻覺特別難抓。你把句子拆開逐項查,每一項都查得到,於是你會覺得這句話是對的。但你沒有查的是那個「配上」。元素之間的連結,才是被編出來的那一段。

上方是兩組各自完整的真實材料,下方被無縫接成一條,被標記出來的是中間那個接縫,也就是被編造的部分
材料分開看都是真的,被編出來的是把它們接在一起的那個接縫。
  • 多數人以為的幻覺

    憑空捏造

    生出一個不存在的人、不存在的書、不存在的名詞。這種確實有,但它最容易被查出來,因為一搜就沒有。

  • 實際上更常見的

    張冠李戴

    真的人、真的機構、真的年份,被接在一起。逐項都查得到,所以逐項查反而會讓你更相信它。

問題是,元素和關係在一個句子裡看起來是連在一起的,讀的時候不會自動分開。所以需要一個很機械的動作把它們拆開。

  • 先圈專有名詞

    人名、機構、法規名稱、年份、數字、書名。這些是元素,它們幾乎都是真的,而且一搜就有。

  • 再圈中間的動詞

    說過、發表、指出、規定、證實、要求。這些是關係,它們把兩個元素接起來,而它們沒辦法被單獨搜尋。

  • 只查被圈起來的動詞

    不是查「這個機構存不存在」,是查「這個機構有沒有說過這句話」。前者一定查得到,後者才是問題所在。

這個拆法之所以有用,是因為它把注意力從「這些字我認得」轉到「這個連結有沒有根據」。下次覺得某段回答怪怪的但說不上來,可以先問自己一句:我剛才查的是元素,還是元素之間的關係。

你會相信它,是因為判斷真假的線索全部失效了

人判斷一段話可不可信,平常靠的不是逐句求證,而是幾個很省力的線索:講得順不順、有沒有猶豫、結構完不完整、細節夠不夠具體。這套方法在人與人之間大致堪用,因為一個人在講不確定的事情時,通常會露出痕跡。

但 AI 不會。它在講對的事情和編的事情時,語氣完全一樣。一樣流暢,一樣篤定,一樣有條理,一樣會補上讓人安心的細節。它不會停頓,不會說「我記得好像是」,也不會在心虛的地方把話說軟。

一句話的判準

你平常用來判斷真假的線索,
在這裡全部失效。

所以「看起來很可信」在這裡不構成任何證據。這也是為什麼經驗豐富的人一樣會中招:他們的經驗告訴他們「這種寫法通常是對的」,而那個經驗剛好被這個工具完美地模仿了。

三個最容易長出幻覺的位置

幻覺不是平均分布的。它集中出現在幾個固定的位置,而這三個位置有一個共同點:有唯一正確答案,但在訓練材料裡出現得不夠密集。

左邊是一段每一行看起來都同樣可信的回答,右邊是同一段回答,其中三個短片段被圈了出來
同一段回答,三個該停下來的位置。它們不會長得比較可疑,所以只能靠你知道要去哪裡看。
  • 位置一

    精確的數字、日期與金額

    越精確的數字越可疑,因為精確本身就是它模仿出來的。

  • 位置二

    出處、書名、頁碼與條號

    這一類的格式極度規律,規律的東西最容易被仿造得像真的。

  • 位置三

    冷門的、或是很新的事情

    材料越稀薄,它越需要靠推測把句子補完整。

越精確的數字,越需要停一下

這一條違反直覺。一般來說,一個人講得出精確數字,代表他查過。但對 AI 來說,精確只是一種文體特徵,它知道這種句子該長什麼樣子,所以它會給你一個長得很像查過的數字。

實務上的做法不是每個數字都查,而是分兩種看待:這個數字如果錯了,會不會改變我的結論。會的話就查,不會的話可以先放著。在我看來,這一條是最容易養成的習慣,因為它不需要專業,只需要一個停頓。

出處和條號是重災區,因為格式太規律

書名、期刊、頁碼、法條編號、標準編號,這些東西有一個共同點:它們的長相高度格式化。而格式化的東西,是最容易被生成得像模像樣的。

這一類我的建議比較硬:只要那個出處會被別人拿去引用,就一定要點開原始連結看過。不是搜尋標題看有沒有結果,是真的打開那一頁,確認裡面真的有那句話。很多時候書是真的、作者是真的,但那句話不在裡面。

越冷門、越新的題目,它越會自己把話補完整

這是三個裡面最難防的一個,因為它跟你的需求正好衝突:你會去問 AI,常常正是因為那件事你不熟、或者太新查不到現成整理。

而材料越稀薄,它就越需要靠推測把句子補完整。它不會告訴你「這部分我的資料不足」,它會用一般情況下最像樣的答案填進去。這個填補的動作對它來說沒有難易之分,對你來說卻是全部的風險所在。

所以遇到冷門或很新的題目,比較安全的順序是反過來的:先確認有沒有一手來源,再決定要不要讓 AI 幫忙整理。而不是先讓它整理,再回頭找來源印證,那樣你找到的往往是你已經被說服的那個版本。

不熟的領域,怎麼用 AI 反過來驗 AI

回到開場那句「太依賴,有錯誤也不清楚問題所在」。要看出一段內容錯在哪,前提是你對那件事有一套自己的判準:這個領域的常識範圍在哪、什麼數字是合理的、哪些說法是這一行不會這樣講的。這些東西不會因為你手上有 AI 就自動長出來。

於是就出現一個很尷尬的結構:AI 最幫得上忙的地方,正是你最沒能力驗收的地方。既然如此,能不能用 AI 來驗 AI?

可以,但不是你想的那一種。直接在原本的對話框裡追問「這是真的嗎」幾乎沒有用,因為它仍然在同一段上下文裡,做的還是同一件事:生成最像樣的回答。它可能改口,也可能用更肯定的語氣重講一次,而這兩種你都分不出來。

有效的二次驗證,至少要換掉一樣

換脈絡:開新對話,只給題目,不給它原本的答案。
換角色:要它反駁,不是要它確認。
換依據:讓它讀你給的一手材料,不是靠它的記憶。

三個條件的共同點是:不要讓它評價自己剛才講過的話。只要它看得到自己原本的答案,它就傾向維護那個版本,就像人很難主動推翻自己五分鐘前的發言。

底下是四個常見情境的實際做法。風險點不一樣,驗證的著力點也不一樣。

  • 知識文章撰寫

    CASE 01

    風險在數字、出處與名詞定義。做法:開新對話,只貼那一句主張,要它找出反對這個說法的證據與來源。找得到反證,代表這件事有爭議;找不到也不等於它是對的,但你至少看到了另一面。

  • 學術簡報與文獻

    CASE 02

    這是重災區,因為文獻格式規律到最容易被仿造。做法:不要讓它憑記憶列文獻,把 PDF 或資料庫連結給它讀,讓它只能從你給的材料裡找。列出來之後,每一篇仍要回原始資料庫核對一次。

  • 社群素材製作

    CASE 03

    風險最高的是名言金句,它是張冠李戴的最佳溫床。做法:一律回推到一手來源,原始演講、原文書、原始貼文。找不到出處就換一句,因為這種內容一旦被轉發出去,掛名的是你。

  • 程式開發撰寫

    CASE 04

    風險在函式名、參數、套件版本與 API 行為。但這一類有個其他情境沒有的優勢:它可以被執行。做法:不要用讀的驗,用跑的驗,並且補上測試案例。

第四格值得多講一句,因為它示範了什麼叫真正的驗證。能被執行的東西,不需要你懂就驗得出來,跑不起來就是錯的,跑得起來但結果不對也會立刻現形。其他三種情境之所以困難,正是因為它們沒有這個「跑一次」的動作,只能靠人去比對。所以在那三種情境裡,你能做的最接近「執行」的事,就是打開一手來源,用眼睛確認那句話真的在裡面。

這篇沒有處理的那一半

知道幻覺長什麼樣子,跟知道什麼時候該花時間查,是兩件事。後者我在3 個必須自己查證的時刻那篇寫過,那篇談的是取捨:不用每次都查,但有幾個時刻不查不行。這一篇補的是另一半:當你決定要查的時候,先看哪裡、怎麼查。

幻覺不是故障,是這個工具的物理性質

幻覺這個詞其實有點誤導。它聽起來像故障,像偶爾發生的異常,像一個總有一天會被修好的缺陷。

但用久了會發現,它比較像是這個工具的物理性質:一個把最像樣的答案生出來的東西,本來就不會區分「最像樣」和「真的」。它不是在說謊,它只是沒有在區分真假這件事上下注。

這也是兩面的分界。對一個有判準的人來說,它把查資料的時間壓縮到幾乎為零,這是真的放大。對一個還沒有判準的人來說,它把錯誤包裝得跟正確一模一樣,而且包裝得比自己寫的還漂亮。

讀完一段 AI 的回答之後

先問一句:
這裡面哪一句,是我查得出真假的。

問得出這一句,你就已經在查證了。問不出來,代表這個題目你還不該一個人做決定。

這一份回答,哪幾句你打算自己驗,哪幾句你打算就這樣相信?

六個帶得走的重點

六個帶得走的重點

  • 幻覺不是胡說八道:亂講的容易認出來,真正會被採信的是結構完整的錯誤。
  • 真正的形狀是張冠李戴:材料幾乎全是真的,被編出來的是元素之間的連結。
  • 逐項查會讓你更相信它:因為每一項都查得到,該查的是那個「配上」。
  • 語氣不能當成證據:它講對的事和編的事,流暢度與篤定程度完全一樣。
  • 三個最容易出錯的位置:精確數字、出處條號、冷門或很新的題目。
  • 用 AI 驗 AI 要先換掉一樣:換脈絡、換角色或換依據,別讓它評價自己剛講過的話。

關於作者

  • 525+場企業與組織培訓
  • 19,500+位學員
  • 150+家教育培訓場域
廖文碩 Kevin

廖文碩 Kevin

簡報培訓講師・網站顧問

廖文碩(Kevin),簡報培訓講師與網站顧問,專注把生成式 AI 接進真正的工作流程,而不是停在工具嘗鮮。教學與顧問範圍涵蓋簡報技巧培訓、網站架設顧問、套裝網站方案與生成式 AI 整合,並經營簡報教學社群 PPT.note 簡報仙貝。長年在企業與校園授課,把判斷標準與工作流程講到學員回去就能自己跑一次。

專業領域

簡報技巧培訓、網站架設顧問、生成式 AI 整合應用

授課時數

累積 1,550 小時以上

這是《AI 時代的 20 個交接點》的其中一篇。這個系列把一件事從問清楚、做出來、講到對方買單、到扛住後果拆成四段,每一段都在跟 AI 交接。 → 看整個系列

延伸閱讀

重點整理

AI 幻覺是什麼?

指 AI 生成出看起來合理、實際上不成立的內容。關鍵是它通常不是胡說八道:人名、機構、年份、術語這些材料多半是真的,被編出來的是它們之間的連結。真的學者配上他沒說過的話、真的機構配上它沒做過的研究,這種「張冠李戴」才是最常見的形態。因為每一個元素單獨查都查得到,逐項查證反而會讓人更相信它。

為什麼 AI 會編造出看起來很真的內容?

因為它做的事情是生成「最像樣的下一段文字」,而不是判斷真假。當手上的材料足夠,最像樣的答案通常就是對的;當材料稀薄,最像樣的答案就只是最像樣而已。它沒有一個內建的機制去區分這兩種情況,也不會在材料不足時停下來告訴你。所以它在講正確內容和編造內容時,語氣、流暢度與細節密度完全一樣。

怎麼看出哪一句是 AI 編的?

先放棄用語氣判斷,因為它講對和講錯時的語氣一模一樣。比較有效的是看位置:精確的數字與日期、出處書名與頁碼條號、冷門或很新的題目,這三個地方風險最高。另外一個實用的動作是把句子拆成「元素」和「元素之間的關係」,分開查。多數人只查了元素,而被編出來的通常是關係,也就是那個把兩個真東西接在一起的「配上」。

哪些內容最容易出現幻覺?

三類特別明顯。第一是精確的數字、日期與金額,因為精確本身就是一種可以被模仿的文體特徵。第二是出處類資訊,包含書名、期刊、頁碼、法條與標準編號,這些格式高度規律,規律的東西最容易被生成得像模像樣。第三是冷門或很新的題目,材料越稀薄,它越需要靠推測把句子補完整。這三類的共同點是有唯一正確答案,但在訓練材料裡出現得不夠密集。

換一個模型或用付費版,就不會有幻覺了嗎?

會減少,不會消失。新一代模型在常見題目上的正確率確實提升,也更常主動說出自己不確定。但幻覺的根源是它在生成最像樣的內容,而不是在查核事實,這個性質不會因為版本或價格改變。實際上更值得注意的是反效果:模型越強,錯的時候看起來越合理,你越不容易發現。與其期待工具解決這件事,不如把力氣花在建立自己的判準。

直接問 AI「這是真的嗎」有用嗎?

在原本那個對話框裡追問,用處有限,因為它仍然在同一段上下文裡生成最像樣的回答,只是題目換成「評估剛才那段話」。它可能改口,也可能用更肯定的語氣重申一次,兩者你都分不出來。用 AI 驗 AI 要有效,至少得換掉一樣:換脈絡(開新對話,只給題目不給它原本的答案)、換角色(要它反駁而不是確認)、或換依據(讓它讀你提供的一手材料,而不是靠記憶)。共同原則是不要讓它評價自己剛講過的話。

不熟的領域要怎麼辦?

先承認一件事:你最不熟的領域,正是它對你最有價值、同時你最沒能力驗收的地方。實務上可行的做法有三個:把問題縮小到你驗得動的範圍、先找到一份一手來源再讓它幫忙整理(而不是反過來)、或是把成果交給懂的人看過再用。另外也可以用 AI 做二次驗證,但必須換脈絡、換角色或換依據,不能在同一個對話框裡追問。如果這些都做不到,那代表這個題目你還不該一個人做決定。

本文更新於 2026 年 8 月。AI 與數位工具改版快速,實際功能與名稱可能已有變動,建議以官方文件為準。