AI输出事实核查与幻觉规避清单
最后更新:2026-08-12· 15 分钟阅读
🚀 快速通道
- ChatGPT 国内版:点击直达↗
- 稳定镜像站:打开镜像↗
- 官方 ChatGPT:chatgpt.com ↗

更新时间:2026-08-12
导读
大模型会把「听起来合理」的句子写得很流畅——包括错误的数字、过期的政策、根本不存在的论文。AI事实核查不是苛刻,而是发布与决策的基本卫生。本文给你一套 主张 → 证据 → 核实 方法、假引用识别术,以及分级发布前清单。工具入口:ChatGPT、Claude、Gemini;说明文档:OpenAI Help。写作流程请配合 AI写作工作流。
这篇解决什么问题?
- 把模糊的「感觉不对」变成可执行的核查步骤
- 识别假引用、假链接、张冠李戴的来源
- 按内容风险决定核查深度
- 在发布前用同一张清单拦住高频事故
为什么「写得像真的」仍然可能是幻觉
模型优化的是续写与指令遵循,不是你的业务数据库。它可能:
- 拼接多个真实片段,得到错误结论
- 发明看起来合法的 DOI、官网路径、法条号
- 把 2023 的政策说成「当前」
- 在你施压「必须给来源」时更敢编
因此:把模型输出当作草稿假设,不是百科终审。
方法:主张 → 证据 → 核实(CEV)
对每一条关键事实,强制走三列:
| 列 | 含义 | 例子 |
|---|---|---|
| Claim 主张 | 模型或你文中的可核查句 | 「X 产品在 2026-01 涨价 20%」 |
| Evidence 证据 | 一手来源类型 | 官网定价页、公报、论文 PDF |
| Verify 核实 | 你打开并记录的结果 | 确认 / 否定 / 部分对 / 找不到 |
提示词:抽出主张清单
从下列文本提取所有可核查主张。
输出表格:主张 | 类型(数字/日期/归因/因果/引用) | 风险(高/中/低) | 建议核对的来源类型
不要证明它们为真,不要编造来源。
文本:{粘贴}
提示词:要求模型「自证」但你不轻信
对主张「{一句话}」:
1) 若你不确定,直接说不确定
2) 给出「我应打开的来源类型」(官网/法规库/论文数据库),不要伪造 URL
3) 列出反证可能长什么样
禁止编造链接与文献题名。
人工核实最小动作
- 打开你信任的域名(官方、监管、出版社),不用模型给的陌生短链
- 核对主体、日期、适用范围是否同一对象
- 把核实结果写回文稿:改正或删除
- 找不到证据 → 删主张或降级为观点
假引用与假链接:专门打法
危险信号
- 论文题名很「完美」,但作者拼写略怪
- DOI/ISBN 格式看起来对,检索无结果
- 同时给出页码、会议名、年份,但互相矛盾
- 「据某某著名期刊」却不肯给可点开的稳定链接
- 中文法规条文号与你印象中的结构不符
核查步骤
- 用主张中的题名/作者在 Google Scholar / 出版社站 / 官网 搜(不要只用对话里的链接)
- DOI 到官方解析器查;查无则标红
- 法规到官方公报或数据库查全文
- 新闻用至少两个独立可靠来源交叉
提示词:引用审查(让模型帮忙找疑点,而非当权威)
审查下列「参考文献/链接」列表,标出可疑项:
- 格式异常
- 无法验证的具体信息(你应写「需人工检索」而非编造检索结果)
- 同一条主张用过弱的二手博客充当唯一证据
输出:条目 | 可疑原因 | 我该去哪类网站核对
列表:{粘贴}
风险分级:决定你要花多少分钟
| 级别 | 内容例子 | 最低核查 |
|---|---|---|
| R0 | 个人日记、明显玩笑、虚构故事 | 无需 |
| R1 | 经验分享、主观评测 | 抽查关键数字;不写假引用 |
| R2 | 教程步骤、产品功能说明 | 对官方文档逐步核对 |
| R3 | 价格、SLA、医疗/法律/财经建议 | 全量主张表;专家或合规复审 |
| R4 | 对外新闻稿、监管报送、合同相关 | 双人复核 + 留存证据链接 |
升级原则:只要出现可行动的建议(别人可能照做),至少按 R2。
发布前事实核查清单
- 已跑「主张提取」表,高风险行全部 Verify
- 文中每个外链人工点开,确认 200 且内容匹配
- 无「据研究表明」却无研究可指
- 时间词(目前/最新/今年)已绑定具体日期或来源
- 对比评测中的分数/排名注明测试条件与日期
- 模型声明「根据我的知识截止」的内容,已用 2026 当下来源刷新
- 截图与引语不歪曲原意
- 敏感信息未泄露(另走 隐私清单)
提示词:发布前自检(辅助,不能替代打开链接)
你是发布前检查员。根据正文列出:
1) 必须人工打开核对的链接与主张(打分 1-5 紧急度)
2) 可能夸大营销的句子
3) 缺少限定条件的绝对化表述
不要尝试联网编造核对结果。
正文:{粘贴}
对话中降低幻觉的写法
| 做法 | 示例 |
|---|---|
| 限定材料 | 「仅根据下列文本,不要补充外部事实」 |
| 强制不确定标记 | 「未知就写【需核实】」 |
| 要推理结构而非权威腔 | 「列出假设与推理链」 |
| 分离创意与事实 | 先要大纲,事实段单独生成并核查 |
| 拒绝逼供 | 不说「必须给出三篇论文」除非你真有库 |
仅根据材料回答。材料没有的信息一律回答「材料未提供」。
输出:结论 | 材料依据(引用短句) | 材料未覆盖的问题
材料:{粘贴}
学习场景同样适用:AI学习工作流。
团队怎么落地
- 定义 R 级:专栏默认 R2,涉及价格/合规默认 R3
- 工具:共享主张表模板(表格或 issue)
- 角色:作者填 Claim,复核人填 Verify,发布人勾清单
- 抽检:每月随机抽 3 篇已发布,回溯链接是否失效、主张是否仍成立
- 事故:若已发布错误,更正文 + 记录「哪一步跳过了 CEV」
常见事故与修正
| 事故 | 修正 |
|---|---|
| 假论文进了稿 | 删引用;全篇搜作者名清扫;加更正 |
| 过期价格 | 改「以官网当天为准」并更新日期 |
| 张冠李戴产品功能 | 回官方 release note 核对版本 |
| 因果写成必然 | 改成相关/可能,并给条件 |
| 翻译歪曲外文来源 | 对照原文关键句重译 |
常见问题
开启网页浏览/插件就不用人工核查了吗?
不能替代。浏览结果仍可能摘要错误或来源不佳。关键主张仍要你打开一手页。
如何快速判断「像假引用」?
题名越长越全、期刊越顶、年份越新——越要检索。真文献经得起检索;假的往往「搜无」。
模型说「我不确定」是好事吗?
是。不确定比自信的错误更安全。把它写成【需核实】并分配谁去查。
内部知识库 RAG 还会幻觉吗?
会。检索错片段或拼错仍可能发生。对 R3+ 同样做 CEV,并检查命中的原文段落。
中文内容要不要核对英文源?
若主张来自英文官方或论文,核对英文一手源更稳;不要只依赖模型中文转述。
相关阅读
下一步阅读
行动路径
今天:对你最近一篇 AI 辅助文稿跑「主张提取」表,至少核实 5 条高风险主张。本周:把发布前清单钉进编辑流程;团队约定 R 级。持续:关键数字只认你打开过的一手来源;模型负责草稿,你负责真相。需要产品说明时以 OpenAI Help 与各官网为准;非敏感练习可用 国内版。
相关内容
ChatGPT中文版常见问题解答(FAQ)
2026 高频问答:注册登录、订阅支付、模型选择、隐私安全与国内访问,附可执行排查步骤。
新手如何入门ChatGPT
7 天入门计划:从注册、第一条提示词到办公与学习场景,含每日任务与可复制提示词。
2026怎么选AI助手:ChatGPT / Claude / Gemini 选型决策
2026 怎么选 AI 助手:按场景、成本、隐私与团队需求对比 ChatGPT、Claude、Gemini,可选加入 DeepSeek;含决策树、一小时盲测与可复制提示词。
AI隐私与数据安全使用清单(个人与团队)
2026 AI 隐私与数据安全清单:数据分级、绝对不粘贴项、个人/团队核对表、第三方镜像风险、保留与训练设置,降低泄露与合规风险。