火龙果经验萃取智能体如何工作:以确定性约束层保障输出可信度
火龙果是一个用于组织经验萃取的对话式智能体。它把大模型限定为提案者,把判定权交给一层确定性代码:八条不可绕过的规则运行在模型输出之上——无原文证据的结论自动降级为推断,判断依据不完整的自动打回追问,仅有单一案例支撑的只能标记为假设。本文说明其五层架构、FIRE 四层分解、六维加权评分与模型路由机制。
摘要
火龙果是一个用于组织经验萃取的对话式智能体。它要解决的核心问题是:大语言模型能够生成看起来合理的专家经验,但无法保证这些经验真的来自被访谈的专家。
本文说明火龙果的解决路径:把大模型限定为「提案者」,把判定权交给一层确定性代码。系统在模型输出之上运行八条不可绕过的规则——无原文证据的结论自动降级为推断,判断依据不完整的自动打回追问,仅有单一案例支撑的只能标记为假设,未通过独特性检验的直接拒绝入库。
配套机制包括:基于 FIRE 模型的四层分解、判断逻辑层的三项固定提取目标、六维加权的素材质量评分、任务级跨厂商模型路由,以及以人工标注黄金集为基准的深度度量方法。
系统的设计立场可以概括为一句话:模型只有提案权,判定权在代码。
1. 问题定义
1.1 隐性知识提取的固有困难
资深从业者的核心能力大部分属于隐性知识。这类知识在长期实践中已经自动化,不再经过可被语言描述的思考过程。当被问及「你是怎么做到的」,专家通常给出的是事后合理化的解释,而非当时真实的判断依据。
因此,经验萃取的难点不在记录,而在提取——需要通过特定的提问结构,把已经沉入自动化状态的判断重新唤回可表述层面。
1.2 引入大模型后新增的困难
大模型显著降低了访谈整理的成本,但引入了一个更隐蔽的问题:
模型能够生成一段读起来完全合理、符合领域常识、但访谈中从未出现过的「专家经验」。
这类内容的危险性高于明显的错误。它无法通过阅读察觉,会被当作专家的真实判断录入知识库,并在后续被用于培训和决策。
更进一步,隐性知识提取任务本身缺乏客观答案——评审者往往无法判断某条结论是专家说的还是模型补的。这使得「靠人工审核把关」在实践中不可靠。
1.3 本文的方法立场
基于上述,火龙果不试图通过提示词工程让模型「不要编造」,而是假定模型一定会在某些情况下编造,并在系统层面使编造无法通过。
2. 系统架构
系统分为五层。数据自下而上流动,控制自上而下施加。
关键在于 L3 的位置。它位于模型调用(L1/L2)与知识产出(L4/L5)之间,任何内容进入知识资产前都必须通过。它由普通代码实现,不含任何模型调用——因此它的行为完全可预测、可测试、可复现。
3. 方法:FIRE 四层分解
系统采用 FIRE 模型组织提取过程,将一段经验拆解为四层:
| 层 | 含义 | 提取的问题 |
|---|---|---|
| F Function 核心职能 | 专家承担的关键职责及其要解决的业务问题 | 他对什么结果负责? |
| I Incident 关键事件 | 含情境、冲突、选择、行动、结果的真实事件 | 当时具体发生了什么? |
| R Reasoning 判断逻辑 | 专家观察信号、形成判断并作出取舍的过程 | 为什么这样做,而不是另一种? |
| E Essence 经验本质 | 经多个事件验证后可复用、可迁移的规律 | 哪些经验能被他人学习? |
3.1 提取顺序的约束
四层不是并列分类,而是有向的提取路径。系统强制自下而上:
- 跳过 I 直接提取 R,得到的是事后合理化解释
- 跳过 R 直接归纳 E,得到的是通用常识
3.2 判断逻辑层的三项固定目标
判断逻辑层是整个系统的价值所在,也是唯一完全存在于专家头脑中、无法从材料表面观察的一层。系统把该层的提取目标固定为三项:
| 目标 | 定义 |
|---|---|
| 决策逻辑 | 几个选项里凭什么选了这一个 |
| 底层原则 | 支撑这个选择、能迁移到其他情境的道理 |
| 失效条件 | 什么情况下会失灵,甚至反向造成损害 |
三项不能直接询问——直接问「你的决策逻辑是什么」,专家给不出答案。系统通过四个探针迂回接近:
| 探针 | 提问方式 | 作用机制 |
|---|---|---|
| 判断线索 | 你当时看到了什么才这么判断 | 将抽象判断锚定回具体感知 |
| 新手错法 | 新人在这一步通常会怎么错 | 差异处即高手判断所在 |
| 刻意不做 | 当时你故意没做什么 | 专业性常存于克制之中 |
| 反事实 | 换一种情况你还会这么做吗 | 逼出边界条件 |
探针是手段,不计入考核;三项目标是否齐备才是判定标准。
4. 约束层:Harness 八条规则
这是系统与「用提示词约束模型」路线的根本分歧点。Harness 的核心函数不是「检查」而是「强制执行」——它不只报告违规,它改写数据状态。
4.1 三条规则的设计意图
R1 是防编造的主闸门。它把「是否编造」这个难以判断的语义问题,转化为「有没有证据引用」这个可以用一行代码判定的结构问题。模型仍然可以生成任何内容,但没有原文锚点的内容永远无法获得「专家经验」的身份。
R7 拦的不是错误,是平庸。一条内容可能完全正确、有原文支撑,但如果通用模型不看访谈材料也能说出同样的话,它就不具备萃取价值。R7 把这类内容挡在库外——因为知识库里混入常识,会稀释真正有价值的部分。
R8 决定追问质量。不带原文锚点的追问(「你当时怎么判断的?」)通常换回一句套话;带锚点的追问(「你说到『先拉三个区域经理聊』——为什么先聊而不是直接改?」)才能换回真实内容。因此无锚点的追问被直接拒绝输出。
4.2 一个必要的诚实说明
Harness 能拦编造,拦不住平庸。
规则层保证的是「不假」,不保证「够深」。一份完全合规、每条都有证据、但只挖到表层动作的产出,可以通过全部八条规则。输出的深度取决于模型的提问能力,这部分无法由确定性代码保证——这也是系统在模型选择上把访谈引导与判断提取归为高价值任务、单独路由到强模型的原因。
5. 质量度量:六维加权评分
系统对访谈素材做分维度评分而非笼统印象分,因为分数必须能回答「该去补哪一块」,否则对萃取师没有操作价值。
事件完整度按六要素填充率计算(情境 / 角色 / 冲突 / 选项 / 行动 / 结果),判断逻辑深度按六槽位填充率计算(信号 / 解读 / 被否决的选项 / 决策规则 / 权衡 / 失效条件)。取值为「未知」的字段不计入填充——这一处理保证了模型无法通过填写占位符提高分数。
6. 模型路由
系统按任务性质路由到不同模型,允许跨厂商。
| 任务类别 | 具体任务 | 路由取向 |
|---|---|---|
| 判断类 | 判断逻辑提取、证据核验、独特性检验、本质归纳、访谈引导 | 强模型 |
| 机械类 | 转写清洗、说话人分流、事件候选识别、槽位抽取、清单生成、追问生成 | 轻量模型 |
分离的依据是成本结构与质量敏感度不匹配:机械类任务吞吐整份逐字稿,token 消耗占绝大部分,但对模型能力不敏感;判断类任务输入量小,却直接决定产出质量。
在实测配置下,判断类任务使用高端模型、机械类保留轻量模型的混合路由,单次会话成本约为全部使用高端模型的七分之一,而质量差异主要集中在判断类任务上。系统对每次调用记录模型、token 用量、成本与延迟,并设有会话级预算熔断。
7. 工程约束
以下机制不改变输出质量,但决定系统能否被可靠地长期运行:
- 内容派生的稳定 ID——所有实体 ID 由内容哈希生成,重跑同样输入得到同样 ID,不产生重复条目
- 部署闸门——三十余条冒烟测试在服务重启前运行,未通过则中止部署,线上保持原状
- 降级可见——模型调用失败时明确提示已降级为规则模式,不静默产出低质结果
- 数据留存策略——提交的访谈材料仅在处理期间驻留,48 小时后自动清除,不用于训练
8. 局限性
以下是系统目前明确做不到的部分。
8.1 无法保证深度。约束层只能保证输出不假,不能保证输出够深。遇到表达能力弱或防备心强的受访者,系统可能连续多轮无实质产出。
8.2 依赖萃取师的现场判断。系统生成追问建议,但由谁问、怎么问、何时停止追问、何时换话题,仍由现场的人决定。系统的定位是放大一位合格萃取师的产能,而非替代萃取师。
8.3 无法处理非语言经验。依赖身体记忆、手感、实时感知的能力(如设备异响判断、现场氛围感知),无法通过文本访谈完整提取。
8.4 独特性检验存在主观边界。R7 依赖模型判断某条内容是否属于常识,这一判断本身可能出错。系统对未做检验的条目发出警告而非拒绝,是在召回与精度之间的一个折中。
8.5 跨案例支撑受访谈成本限制。R3 要求两个以上案例才能标记为已验证方法,但实践中受访者往往只能提供一个完整案例。这导致大量产出停留在假设状态——这是真实的限制,不是系统缺陷。
9. 结语
火龙果的技术路线可以概括为一句话:
不试图让模型变得诚实,而是让不诚实的输出无法通过。
这一取向的代价是产出更慢、更多内容停留在「待追问」和「假设」状态。收益是:进入知识库的每一条内容,都能追溯到访谈原文中的具体片段。
对于组织知识资产而言,一份标注清楚哪里还没挖到的产出,价值高于一份看起来完整但无法核验的报告。
术语表
| 术语 | 定义 |
|---|---|
| 经验萃取 | 把资深从业者说不清的判断,通过结构化访谈与追问,转化为他人可学习、可复用的知识资产的过程 |
| 经验萃取智能体 | 用于辅助或执行经验萃取的对话式 AI 系统,其核心能力是追问而非总结 |
| Harness | 运行于模型输出之上的确定性约束层,拥有改写数据状态的权限 |
| 推理三件套 | 判断逻辑层的三项固定提取目标:决策逻辑、底层原则、失效条件 |
| 独特性检验 | 判定某条结论是否为通用模型不看原文即可得出的常识 |
常见问题
把经验变成资产
企业组织经验萃取、关键岗位经验资产化、专家经验成书、互动课程开发,欢迎联系嗨森教育。
火龙果经验萃取智能体 ↗ 专家经验成书服务 FIRE 实战营咨询:盖尔老师 电话 / 微信 13901614328(请备注来意) 邮箱 support@joyelearn.cn
本文描述的系统为 JoyeLearn 嗨森教育自主开发并在实际企业经验萃取项目中运行。文中所述规则、维度权重与流程均对应系统中实际实现的代码逻辑。 ← 返回洞察分享