首页 / 洞察分享 / 经验萃取
技术说明2026 年 8 月 22 日

火龙果经验萃取智能体如何工作:以确定性约束层保障输出可信度

火龙果是一个用于组织经验萃取的对话式智能体。它把大模型限定为提案者,把判定权交给一层确定性代码:八条不可绕过的规则运行在模型输出之上——无原文证据的结论自动降级为推断,判断依据不完整的自动打回追问,仅有单一案例支撑的只能标记为假设。本文说明其五层架构、FIRE 四层分解、六维加权评分与模型路由机制。

摘要

火龙果是一个用于组织经验萃取的对话式智能体。它要解决的核心问题是:大语言模型能够生成看起来合理的专家经验,但无法保证这些经验真的来自被访谈的专家。

本文说明火龙果的解决路径:把大模型限定为「提案者」,把判定权交给一层确定性代码。系统在模型输出之上运行八条不可绕过的规则——无原文证据的结论自动降级为推断,判断依据不完整的自动打回追问,仅有单一案例支撑的只能标记为假设,未通过独特性检验的直接拒绝入库。

配套机制包括:基于 FIRE 模型的四层分解、判断逻辑层的三项固定提取目标、六维加权的素材质量评分、任务级跨厂商模型路由,以及以人工标注黄金集为基准的深度度量方法。

系统的设计立场可以概括为一句话:模型只有提案权,判定权在代码。

1. 问题定义

1.1 隐性知识提取的固有困难

资深从业者的核心能力大部分属于隐性知识。这类知识在长期实践中已经自动化,不再经过可被语言描述的思考过程。当被问及「你是怎么做到的」,专家通常给出的是事后合理化的解释,而非当时真实的判断依据。

因此,经验萃取的难点不在记录,而在提取——需要通过特定的提问结构,把已经沉入自动化状态的判断重新唤回可表述层面。

1.2 引入大模型后新增的困难

大模型显著降低了访谈整理的成本,但引入了一个更隐蔽的问题:

模型能够生成一段读起来完全合理、符合领域常识、但访谈中从未出现过的「专家经验」。

这类内容的危险性高于明显的错误。它无法通过阅读察觉,会被当作专家的真实判断录入知识库,并在后续被用于培训和决策。

更进一步,隐性知识提取任务本身缺乏客观答案——评审者往往无法判断某条结论是专家说的还是模型补的。这使得「靠人工审核把关」在实践中不可靠。

1.3 本文的方法立场

基于上述,火龙果不试图通过提示词工程让模型「不要编造」,而是假定模型一定会在某些情况下编造,并在系统层面使编造无法通过。

2. 系统架构

系统分为五层。数据自下而上流动,控制自上而下施加。

图 1 系统五层架构 数据自下而上流动,控制自上而下施加。约束层位于模型调用与知识产出之间,不可绕过。 L5 导出层 Markdown 知识包 · 双向链接 · ZIP obsidian.py L4 加工层 事件抽取 · R层提取 · 证据核验 · 成卡 extract.py · pipeline.py L3 约束层 Harness:8 条确定性规则 + 6 维评分 rules.py · scoring.py ← 判定权在此 纯代码,无模型调用 L2 路由层 任务级模型路由 · 跨厂商 · 成本记账 llm.py · profiles/*.json L1 对话层 模型主导访谈 · 槽位抽取 · 追问生成 dialog.py · interviewer.py

关键在于 L3 的位置。它位于模型调用(L1/L2)与知识产出(L4/L5)之间,任何内容进入知识资产前都必须通过。它由普通代码实现,不含任何模型调用——因此它的行为完全可预测、可测试、可复现。

3. 方法:FIRE 四层分解

系统采用 FIRE 模型组织提取过程,将一段经验拆解为四层:

层含义提取的问题
F Function 核心职能专家承担的关键职责及其要解决的业务问题他对什么结果负责?
I Incident 关键事件含情境、冲突、选择、行动、结果的真实事件当时具体发生了什么?
R Reasoning 判断逻辑专家观察信号、形成判断并作出取舍的过程为什么这样做,而不是另一种?
E Essence 经验本质经多个事件验证后可复用、可迁移的规律哪些经验能被他人学习?

3.1 提取顺序的约束

四层不是并列分类,而是有向的提取路径。系统强制自下而上:

3.2 判断逻辑层的三项固定目标

判断逻辑层是整个系统的价值所在,也是唯一完全存在于专家头脑中、无法从材料表面观察的一层。系统把该层的提取目标固定为三项:

目标定义
决策逻辑几个选项里凭什么选了这一个
底层原则支撑这个选择、能迁移到其他情境的道理
失效条件什么情况下会失灵,甚至反向造成损害

三项不能直接询问——直接问「你的决策逻辑是什么」,专家给不出答案。系统通过四个探针迂回接近:

探针提问方式作用机制
判断线索你当时看到了什么才这么判断将抽象判断锚定回具体感知
新手错法新人在这一步通常会怎么错差异处即高手判断所在
刻意不做当时你故意没做什么专业性常存于克制之中
反事实换一种情况你还会这么做吗逼出边界条件

探针是手段,不计入考核;三项目标是否齐备才是判定标准。

4. 约束层:Harness 八条规则

这是系统与「用提示词约束模型」路线的根本分歧点。Harness 的核心函数不是「检查」而是「强制执行」——它不只报告违规,它改写数据状态。

图 2 Harness 八道闸门:拦截与强制降级 enforce() 改写状态,而非仅报告违规。智能体只能提交,无法决定提交物以什么状态存在。 模型提案 → R1 有原文证据? 降级为 AI 推断 R2 判断依据完整? 置为待追问 R3 ≥2 个案例? 降级为假设 R4 专家已确认? 回退待确认 R5 版本已递增? 强制新建版本 R6 unknown 有出口? 生成追问 R7 通过独特性检验? 拒绝入库 R8 追问带锚点? 拒绝输出 八道全过 方可入库 R1 把「是否编造」这个语义问题,转化为「有没有 evidence_refs」这个一行代码可判定的结构问题。 R7 拦的不是错误,是平庸 ——正确但通用模型不看原文也能说出的内容,不具备萃取价值。

4.1 三条规则的设计意图

R1 是防编造的主闸门。它把「是否编造」这个难以判断的语义问题,转化为「有没有证据引用」这个可以用一行代码判定的结构问题。模型仍然可以生成任何内容,但没有原文锚点的内容永远无法获得「专家经验」的身份。

R7 拦的不是错误,是平庸。一条内容可能完全正确、有原文支撑,但如果通用模型不看访谈材料也能说出同样的话,它就不具备萃取价值。R7 把这类内容挡在库外——因为知识库里混入常识,会稀释真正有价值的部分。

R8 决定追问质量。不带原文锚点的追问(「你当时怎么判断的?」)通常换回一句套话;带锚点的追问(「你说到『先拉三个区域经理聊』——为什么先聊而不是直接改?」)才能换回真实内容。因此无锚点的追问被直接拒绝输出。

4.2 一个必要的诚实说明

Harness 能拦编造,拦不住平庸。

规则层保证的是「不假」,不保证「够深」。一份完全合规、每条都有证据、但只挖到表层动作的产出,可以通过全部八条规则。输出的深度取决于模型的提问能力,这部分无法由确定性代码保证——这也是系统在模型选择上把访谈引导与判断提取归为高价值任务、单独路由到强模型的原因。

5. 质量度量:六维加权评分

系统对访谈素材做分维度评分而非笼统印象分,因为分数必须能回答「该去补哪一块」,否则对萃取师没有操作价值。

图 3 多轮萃取闭环与六维评分 评分的作用不是给结论打分,是回答「下一轮该补哪一块」。 提交逐字稿 分段与说话人分流 R 层提取 六维评分 缺口定位 生成带原文锚点的追问 → 下一轮访谈 六维加权(合计 100) 判断逻辑深度 25 事件完整度 25 场景覆盖度 15 证据可追溯性 15 边界与反例 10 跨案例支撑 10 判断逻辑 + 事件完整 = 50 分 取向:宁可少一个场景,不可少一层判断。 取值 unknown 的字段不计入填充率 —— 模型无法用占位符刷分。

事件完整度按六要素填充率计算(情境 / 角色 / 冲突 / 选项 / 行动 / 结果),判断逻辑深度按六槽位填充率计算(信号 / 解读 / 被否决的选项 / 决策规则 / 权衡 / 失效条件)。取值为「未知」的字段不计入填充——这一处理保证了模型无法通过填写占位符提高分数。

6. 模型路由

系统按任务性质路由到不同模型,允许跨厂商。

任务类别具体任务路由取向
判断类判断逻辑提取、证据核验、独特性检验、本质归纳、访谈引导强模型
机械类转写清洗、说话人分流、事件候选识别、槽位抽取、清单生成、追问生成轻量模型

分离的依据是成本结构与质量敏感度不匹配:机械类任务吞吐整份逐字稿,token 消耗占绝大部分,但对模型能力不敏感;判断类任务输入量小,却直接决定产出质量。

在实测配置下,判断类任务使用高端模型、机械类保留轻量模型的混合路由,单次会话成本约为全部使用高端模型的七分之一,而质量差异主要集中在判断类任务上。系统对每次调用记录模型、token 用量、成本与延迟,并设有会话级预算熔断。

7. 工程约束

以下机制不改变输出质量,但决定系统能否被可靠地长期运行:

8. 局限性

以下是系统目前明确做不到的部分。

8.1 无法保证深度。约束层只能保证输出不假,不能保证输出够深。遇到表达能力弱或防备心强的受访者,系统可能连续多轮无实质产出。

8.2 依赖萃取师的现场判断。系统生成追问建议,但由谁问、怎么问、何时停止追问、何时换话题,仍由现场的人决定。系统的定位是放大一位合格萃取师的产能,而非替代萃取师。

8.3 无法处理非语言经验。依赖身体记忆、手感、实时感知的能力(如设备异响判断、现场氛围感知),无法通过文本访谈完整提取。

8.4 独特性检验存在主观边界。R7 依赖模型判断某条内容是否属于常识,这一判断本身可能出错。系统对未做检验的条目发出警告而非拒绝,是在召回与精度之间的一个折中。

8.5 跨案例支撑受访谈成本限制。R3 要求两个以上案例才能标记为已验证方法,但实践中受访者往往只能提供一个完整案例。这导致大量产出停留在假设状态——这是真实的限制,不是系统缺陷。

9. 结语

火龙果的技术路线可以概括为一句话:

不试图让模型变得诚实,而是让不诚实的输出无法通过。

这一取向的代价是产出更慢、更多内容停留在「待追问」和「假设」状态。收益是:进入知识库的每一条内容,都能追溯到访谈原文中的具体片段。

对于组织知识资产而言,一份标注清楚哪里还没挖到的产出,价值高于一份看起来完整但无法核验的报告。

术语表

术语定义
经验萃取把资深从业者说不清的判断,通过结构化访谈与追问,转化为他人可学习、可复用的知识资产的过程
经验萃取智能体用于辅助或执行经验萃取的对话式 AI 系统,其核心能力是追问而非总结
Harness运行于模型输出之上的确定性约束层,拥有改写数据状态的权限
推理三件套判断逻辑层的三项固定提取目标:决策逻辑、底层原则、失效条件
独特性检验判定某条结论是否为通用模型不看原文即可得出的常识

常见问题

火龙果经验萃取智能体是什么?
火龙果是 JoyeLearn 嗨森教育开发的对话式经验萃取智能体,用于把资深从业者说不清的判断,通过结构化访谈与多轮追问,转化为可复用的知识资产。它的核心特征是把大模型限定为提案者,由一层确定性代码判定每条内容能否进入知识库。
为什么说「模型只有提案权,判定权在代码」?
因为系统不依赖提示词让模型「不要编造」,而是假定模型一定会在某些情况下编造,并在模型输出之上运行八条确定性规则。这层代码不含任何模型调用,行为完全可预测、可测试、可复现。它不只报告违规,而是直接改写数据状态——智能体只能提交,无法决定提交物以什么状态存在。
怎么防止 AI 编造专家经验?
关键机制是证据绑定。任何标记为「原文事实」或「专家判断」的结论,必须绑定访谈原文中的具体片段;没有原文锚点的内容会被自动降级为 AI 推断,无法获得专家经验的身份。这把「是否编造」这个难以判断的语义问题,转化为「有没有证据引用」这个可以用一行代码判定的结构问题。
经验萃取智能体和普通聊天机器人有什么区别?
普通聊天机器人做的是总结,经验萃取智能体做的是追问。前者把专家说出口的内容整理成文档,而专家能说出口的通常是同行都会说的常识;后者需要识别哪些判断没有被讲清楚,并生成带原文锚点的追问,去获取专家自己都未必意识到的判断依据。
这套系统能替代经验萃取师吗?
不能。系统生成追问建议,但由谁问、怎么问、何时停止追问、何时换话题仍由现场的人决定。系统的定位是放大一位合格萃取师的产能,而非替代萃取师。此外,依赖身体记忆与实时感知的能力,无法通过文本访谈完整提取。

把经验变成资产

企业组织经验萃取、关键岗位经验资产化、专家经验成书、互动课程开发,欢迎联系嗨森教育。

火龙果经验萃取智能体 ↗ 专家经验成书服务 FIRE 实战营

咨询:盖尔老师 电话 / 微信 13901614328(请备注来意) 邮箱 support@joyelearn.cn

本文描述的系统为 JoyeLearn 嗨森教育自主开发并在实际企业经验萃取项目中运行。文中所述规则、维度权重与流程均对应系统中实际实现的代码逻辑。  ← 返回洞察分享