跳转到主要内容

Agent 如何把外部变化处理成信号

从源池维护、信号识别,到多 Agent 处理、Eval 质量把关与解读交付,可见信号把分散变化加工成可信、可解释、可进入工作流的判断素材。

1

源池维护与接入

来源可核对起点

“看哪些源、如何维护?”

源池不是为了抓取更多信息,而是先决定什么值得进入系统 —— 这道选择,就是信号质量的第一道把关

信息源发现
来源分组
角色/权重/频率标注
来源登记
Agent可调用

源池维护与接入

“你们看哪些源、如何维护?”

输入质量决定一切。可见信号不是随机抓取,而是围绕 对象 / 领域 / 平台 / 来源角色 持续维护一个源池。信息进入系统时保留来源、时间、对象和上下文——这是后续一切可核对的起点。

Source Registry 记录来源类型、对象关系、更新频率、可信度与适用场景;行业经验在这里成为系统的选择标准 —— 先决定该看什么,再让信息进入处理链路。

连接协议(MCP)Source Registry来源·时间·对象绑定Provenance

人的判断

行业经验决定哪些源值得长期追踪,并定义一个源在系统里的角色与权重。

2

识别信号

“信息很多,哪些会被识别成信号?”

信息进来不等于信号成立——先分清哪些是真正的变化,噪音和重复止步于此,不进入下一步处理。

原始信息流
去重/聚类
对象识别
时间标注
优先级判断

识别信号

“信息很多,哪些会被识别成信号?”

信息进入系统后,先被整理成「变化」。系统合并重复信息、聚合相近线索,把动态绑定到 公司 / 产品 / 人物 / 技术 / 行业 / 议题对象,再判断哪些变化值得继续处理。

这一段以 确定性程序为主,不交给 Agent 即兴发挥 —— 先用规则过滤噪音,复杂度只在评估证明有益时才加入。

去重聚类对象识别(Entity Resolution)优先级判断
3

多 Agent 处理

“Agent 如何分工处理不同信号?”

不同信号,进入不同的 Agent 工作流——补齐上下文、解释变化意义,整理成可继续使用的信号。

候选信号
事实还原
背景解释
影响判断
输出草稿

多 Agent 处理

“Agent 如何分工处理不同信号?”

不同信号进入不同处理路径:简单信号走标准工作流,复杂信号由 多个 Agent 分工 处理事实、背景与影响。Agent 不是泛化黑盒,而是被工作流、工具、Skills 和输出规范约束的处理单元。

Skill 是可复用的任务能力包:行业框架、解释结构、判断标准——也就是团队的 人文判断与行业 know-how —— 通过 Skill 封装进链路,让 Agent 在不同任务里调用。能力的杠杆也从「写 prompt」转向 为模型配置最合适的上下文

上下文工程多 Agent 协作工作流编排SkillsOutput Schema

人的判断

人文理解与行业 know-how 进入解释框架(为什么重要、影响谁、追踪什么),并沉淀为 Agent 可调用的 Skills。

Harness 运行与控制层

可信 · 来源与证据可核对

“Agent 如何分工处理不同信号?”

这条链路被运行环境与可核对的证据包住,而不是一次裸模型调用。

任务进入
Harness接管
分配Agent
失败处理
可核对的结果

Harness 运行与控制层

“Agent 如何分工处理不同信号?”

Harness 是 Agent 的运行与控制层 —— 决定 Agent 如何被组织运行、工具如何被调用、上下文如何传递、失败如何处理、过程如何留痕。正因为有这一层,链路不是一次裸模型调用,而是被运行环境、规则和 可核对的来源与证据 包住的系统。

可信不是一句「AI 生成」,而是每个关键判断都能回到来源与证据,并标明哪些已确认、哪些仍在观察、哪些来源之间存在分歧。

工具调用失败处理与回退人工检查点来源与证据可核对
4

Eval 质量门

可信 · 通过才放行

“Agent 如何分工处理不同信号?”

Agent 的结果先过质量评估,通过了才进入工作流——质量门把不合格输出挡在交付之前。

输出结果
Eval评估
评分/分类
(不通过) 回流Loop
(通过) 信号卡片

Eval 质量门

“Agent 如何分工处理不同信号?”

Agent 的结果 不直接交付,先过一道质量门。Eval 不是一次性验收,而是 持续的、与系统复杂度匹配 的质量测量:用从真实失败中提炼的评测集判断输出是否达标、把反复出现的问题按 badcase 归类、改动后跑回归确认整体没有退化。

关键原则是 评判产出本身,而不是它走的路径 —— 只要结果对,不强求 Agent 按固定步骤完成。通过评估的结果,会被整理成结构化的信号卡片,向下进入解读与工作流;未通过的进入回流

Evalbadcase 分类回归测试产出导向评估

人的判断

人的判断被沉淀成 good case / bad case、失败类型与评分口径——这是系统「为何可信」的来源。

5

Loop 越用越准

“系统如何越用越准?”

这条链路在真实信息流中持续校准——每一次运行,都会成为下一轮处理质量的输入。

真实运行/输出
Trace
反馈/人工评审
Badcase/Golden
Evals
来源 / 规则 / 方法 / Pipeline 更新

Loop 越用越准

“系统如何越用越准?”

处理链路不是一次性设定。每次运行都会留下记录(Trace),错误与偏差进入反馈,有效判断沉淀为 golden case,反复出现的问题转化为评估项,最后推动来源、规则、处理方法和工作流更新。

这是「写 prompt → 配上下文 → 设计 Harness」之后的下一步:设计驱动 Agent 的循环本身 —— Trace 显示发生了什么,反馈解释什么重要,Evals 让期望可复用。Loop 跳出线性主链,包住整条链路。

Trace反馈Evals回流更新持续闭环

人的判断

判断规则与失败类型沉淀进迭代标准,决定下一轮该改什么。

继续探索

continue to explore
Agent处理(当前位置)