ChatGPT 給了個怪答案,不少人的結論是「這題它不會」,接著換工具或自己查。Google Research 的兩篇研究提醒我們,這個結論常常下得太早:模型很可能存著那份知識,只是沒被喚起。以下是三個可複製貼上的 ChatGPT prompt 技巧。

查事實類問題答錯時,Google 研究發現模型多半「知道」,只是沒想起來

示意圖:查事實類問題答錯時,Google 研究發現模型多半「知道」,只是沒想起來

Google Research 用維基百科衍生的 2,150 個事實測了 13 個模型,發現 GPT-5、Gemini-3 這類前沿模型已存進 95% 到 98% 的事實,不開額外思考時卻有 26-34% 無法直接回想。開啟思考後,這批事實約能找回 40-65%。

另一篇研究指出多想有用的原因:模型寫出中間的字就多了一段運算空間,寫出相關事實還會替答案鋪路。下面三招都讓 ChatGPT 先寫出中間步驟。研究直接測的是開啟思考(推理)功能的結果,用之前先確認你的 ChatGPT 模型有開思考。這三招 Google 沒測過,我們也沒實測,所以不附 before/after 輸出,請拿自己的題目驗證。

Step 1:先請 ChatGPT 列出相關事實,再回答

示意圖:先請 ChatGPT 列出相關事實,再回答

先請它把相關事實列出來,再讓它作答。這段 prompt 要求 ChatGPT 在回答前列出 5 件相關事實或背景,並標上確定程度,列完才回答。它適合有標準答案的單點事實題,例如某個名詞的定義、某套制度的由來。

Prompt:

我的問題:〔貼上你的題目〕

回答之前,先列出你記得跟這個問題有關的 5 件事實或背景,每一條註明你有多確定(高/中/低)。列完再回答。

為什麼可能有用:研究稱這個機制為事實啟動。研究舉的例子是:被問尼泊爾第 10 任國王是誰,推理模型可能先列出前九任,這段暖身讓第十任更容易浮現。

怎麼確認做對了:它先列出 5 條帶確定程度的清單才作答。清單裡有你一眼看出錯的條目,整份答案先別採信。

Step 2:換三種問法,看答案穩不穩

示意圖:換三種問法,看答案穩不穩

同一題問三次,看答案站不站得住。請 ChatGPT 用三種不同說法重述你的問題,各答一次,最後列出三個答案不一致的地方。答案不一致的地方要查。

Prompt:

我的問題:〔貼上你的題目〕

請用三種問法重述我的問題:①換成別人會怎麼問;②把問題反過來問(例如把「某某提出了什麼理論」改成「某某理論是誰提出的」);③先給一句結論,再解釋原因。各答一次,最後列出三個答案不一致的地方。

為什麼可能有用:VentureBeat 轉述該研究時提到,模型對「反向問題」(問主詞而不是受詞)特別吃力,也提醒要測試不同問法,別只信單一 prompt。所以第二種問法刻意把問題反過來問。

舉例:你是 HR,要補一段管理模型的由來,第一版年份怪怪的。請它照上面三種問法各答一次,盯著不一樣的人名、年份與數字。

怎麼判讀(編輯整理):

三個答案的狀況 怎麼解讀 下一步
說法一致 模型比較有把握,但也可能是同一個錯誤重複三次 要引用的數字仍抽查
人名、年份、數字不一致 這幾處最可能記錯 標出來,自己查
流暢但空泛 它在給安全答案 補脈絡,參考反問式 prompt

Step 3:請它回頭標出不確定的事實,這一步要你自己查

示意圖:請它回頭標出不確定的事實,這一步要你自己查

ChatGPT 給了一份看起來很完整的答案,而你準備拿去引用時,再補一句:請它逐條檢查前面列出的事實與答案裡的人名、年份、數字,標出不確定、可能記錯的。標記只能縮小查證範圍,查證仍由你完成,這一步省不掉。

Prompt:

把你前面回答裡列出的事實,以及答案中的人名、年份、數字,逐條檢查,哪幾條你其實不確定、可能記錯?標出來,我自己去查。

為什麼接在 Step 1 後:Google 另一篇研究發現,推理中只要混進一個幻覺的中間事實,最後答對的機率就明顯下降。模型標的「不確定」只是線索,自己查才是重點。

三招幫不上忙的情況:

  • 研究測的是維基百科類事實。公司內部資料、小眾專業領域,模型可能真的沒學過;對沒存進去的事實,思考只能找回 5-15%(出自第一篇部落格)。
  • 這類題目要改成把資料貼給它,貼之前先確認公司資安規範允許;本文三招只問公開知識,不必貼公司內部或機密資料。VentureBeat 也提醒,別把補資料(RAG)當萬用解,先判斷模型是不是本來就有答案。

怎麼知道這三招有沒有用?拿上週答不好的那題重跑一次

示意圖:怎麼知道這三招有沒有用?拿上週答不好的那題重跑一次

挑一個上週 ChatGPT 答得怪、而你查得到正解的問題。十分鐘內依序貼上三招的 prompt,每招各開一個新對話,免得後面的答案被前面影響,記下哪一招讓答案更可靠、或讓你更快找出錯處。這題要有標準答案可核對,也不能涉及公司機密。團隊版:每人挑一題,週會花十分鐘交換哪一招有用、哪裡仍要查。轉述給老闆時,一句話就夠(編輯整理):「前沿模型多數事實其實存著,先試追問,再決定要不要補資料或換工具。」

把結果記成一張小表:哪類任務、哪一招有效、哪裡仍要自己查。這張表的邏輯跟智谷的個人 AI 技能診斷相同,以工作任務為單位,盤點 AI 幫得上忙的地方。累積一週,就知道哪些題可信。

只學一次、隔週就忘,是員工上完 AI 課卻什麼都沒改變的常見樣子。想擴充指令庫,可從20 套必學的 ChatGPT 指令挑幾條;團隊想練成習慣,可看企業 AI 應用力培訓與把 AI 工具變成競爭力。

FAQ

常見誤解:同一題問三次,答案都一樣就代表是對的?

不代表。三次一致只說明模型對這個說法比較穩,它也可能穩定地記錯同一件事。要引用的數字、人名與年份,一致時仍要抽查一次;三次都不一致的細節,更要回頭查原始來源,別因為其中一個答案寫得流暢就採用。

常見誤解:叫 ChatGPT「想久一點」就等於研究裡的多想?

未必。研究測的是模型本身的推理能力,本文三招是用提問把中間步驟寫出來,Google 沒有測過這些 prompt。它們是依機制推演的做法,有沒有效,要拿你自己的問題驗證,並記下哪一招有用。

常見誤解:用了這三招,AI 幻覺就會消失?

不會,研究也沒有這樣說。Google 的另一篇研究反而發現,推理過程只要出現一個幻覺的中間事實,最後答對的機率就明顯下降。三招能幫你多找回一些答案,並把可疑處標出來,最後的查證仍要靠人。

哪些題目不必用這三招?

需要即時資訊的題目(今天的匯率、本週新聞)要靠搜尋或原始網站,模型的記憶幫不上忙。純創意發想沒有標準答案可以核對,標記不確定也沒有意義。簡單、可以立刻驗證的問題,直接查更快。

關於智谷

智谷網絡(Kvalley Network)自 1996 年創立,專注企業 AI 轉型與中高階主管培訓,累計服務 3,000+ 家企業、75,000+ 小時訓練執行時數、年度訓練 30,000+ 人次。

研究來源

  • Google Research 2026〈Empty shelves or lost keys? Recall is the bottleneck for parametric factuality〉https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/
  • Google Research 團隊 2026 論文〈Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality〉arXiv:2602.14080 https://arxiv.org/abs/2602.14080
  • Google Research 2026〈Thinking to recall: How reasoning unlocks parametric knowledge in LLMs〉https://research.google/blog/thinking-to-recall-how-reasoning-unlocks-parametric-knowledge-in-llms/
  • Google Research 團隊 2026 論文〈Thinking to Recall: How Reasoning Unlocks Parametric Knowledge in LLMs〉arXiv:2603.09906 https://arxiv.org/abs/2603.09906
  • VentureBeat 2026〈Frontier models can recover up to 65% of facts they can’t directly recall just by thinking longer〉https://venturebeat.com/orchestration/frontier-models-can-recover-up-to-65-of-facts-they-cant-directly-recall-just-by-thinking-longer

CTA:想讓團隊把這幾個追問習慣練成日常,預約一次智谷企業 AI 培訓諮詢。