
最近一年,几乎所有人都在谈 Agent:自动写方案、自动跑流程、自动协作,像下一代“数字员工”。
很多企业第一次在内部系统里用自然语言驱动流程时,会产生一种错觉:只要接入一个 Agent 平台,未来就来了。
但我们在真实项目里看到的情况,恰恰相反。
Agent 并没有让事情变简单,它只是把复杂性从前台转移到了后台。
当 Agent 真正开始参与业务,真正决定系统能不能跑起来、跑得稳、跑得久的,是背后支撑它的 AI Infra。
下面这段经历来自我们最近的一次脱敏实践——我们尝试让一个“业务 Agent”接入内部系统,做三件事:
- 读懂业务上下文(从知识库/历史记录中补全信息)
- 调用工具完成动作(查询/更新/触发审批)
- 把结果回写系统,并能复盘与迭代
结果是:
Agent 的“聪明”不是第一天卡住我们的点。第一天卡住我们的,是系统有没有为“不确定性”做好准备。
01
Agent 是结果,不是起点
如果只看 Demo,Agent 很容易让人误判:它能拆任务、调用工具、自动执行,看起来像“会思考的系统”。
但一旦进入真实业务,问题会集中暴露:
- 数据不全、不准、不可用:Agent 要做的判断依赖历史记录、业务主数据、过程事件,但这些在很多系统里要么缺失、要么口径不一致、要么无法在线取到。
- 工具接口不稳定,权限混乱:Agent 调一次接口失败不致命,调一串接口失败就会把流程拖进“半成品状态”;更麻烦的是,权限边界不清会让系统不敢放开写操作。
- 任务执行不可回溯,不可审计:出了问题你不知道它“看到了什么、调用了什么、为什么这么做”,只能猜。
- 行为结果不可解释,也不可优化:没有对照、没有回放、没有指标,最后只能靠“调 prompt + 祈祷”。
这些现象,看起来像 Agent 不够聪明,但本质上是:
底层基础设施没有为“可变输入、概率输出、长链路执行”的系统形态准备好。
我们更愿意把 Agent 看成一辆 F1:
你可以优化引擎、优化驾驶策略,但如果赛道还是坑坑洼洼的土路,性能永远发挥不出来。
这条“赛道”,就是 AI Infra。

02
传统数据基础设施,已经不够用了(因为数据第一次变成“生产资料”)
过去十多年,企业的数据基础设施主要围绕“人用数据”来设计:
报表给人看、数据集市给分析师用、离线为主、治理更像“规范问题”。
但当 Agent 进入系统后,数据第一次变成了“给模型和智能体用的生产资料”。
它带来三个根本变化:
01.数据不再是静态资产,而是流动资产
Agent 的行为会持续消耗数据、生成新数据、暴露数据问题,数据进入持续演化状态。
02.多模态成为常态,而非例外
文本、日志、图片、音频、操作轨迹同时存在,传统的单一表结构很难承载。
03.实时性和反馈闭环变得关键
数据不只是“被查询”,而是参与决策、执行与优化。
在这种背景下,单纯的“大数据平台 + AI 工具拼装”很快会出现断层——
因为缺少端到端的闭环能力。
03
AI Infra 的核心是闭环
很多讨论 AI Infra 的文章第一反应是算力、GPU、推理加速。这些当然重要,但在工程实践里,它们往往不是最先卡住团队的地方。
真正让项目停滞的,通常是这些更“脏”的问题:
- 数据从哪里来?口径是否可信?是否可复用?
- 模型输出如何被验证?错误如何被记录与定位?
- Agent 的行为能否被追踪、回放和分析?
- 新的数据与反馈,是否能反哺系统,而不是被丢弃?
这四个问题背后指向的是有没有形成“智能系统的闭环能力”。
我们把一个成熟的 AI Infra 拆成三件事(也是我们在项目里按顺序补齐的三块地基)
1. Data for AI:让数据天然适配模型与 Agent 的使用方式
不是说是“把数据扔进向量库就完事”这么简单,是需要回答:
- 业务对象的统一口径是什么?(主数据/数据契约)
- 过程事件如何被采集?(行为日志/操作轨迹/关键字段落库)
- 哪些数据能在线取到、能用于决策?(实时/准实时链路)
- 这些数据能否被复盘?(版本、时间、来源可追踪)
如果没有这些,“Agent 看起来能对话”,但对话背后无法可靠执行。
2. AI for Data:用 AI 反过来提升数据加工、治理与理解效率
我们在交付里最直接的体感是:AI 不仅是“消费数据”,它也应该用于“生产与治理数据”——比如自动补齐字段解释、发现口径冲突、生成数据文档、辅助标注与对齐。
否则,数据治理的成本会在 Agent 时代被放大。
3. 闭环进化:把真实行为与结果变成下一轮优化输入
这一步通常最难,但也最关键。因为它要求你把“结果”结构化保存下来:
- 这次任务输入是什么?(上下文、检索结果、工具返回)
- 执行链路是什么?(每一步 tool call、耗时、失败原因)
- 输出质量如何?(评测指标/人工验收/线上反馈)
- 下一轮怎么改?(策略更新、数据补齐、工具修复)
没有闭环,Agent 只能停留在“演示智能”;有了闭环,Agent 才可能进入“可持续演进”。
04
另一个经常被低估的坑
当 Agent 真正参与业务流程时,复杂性会在“执行侧”集中爆发。
我们把它叫 Agent Infra——它和 AI Infra 有交叉,但关注点更偏“长期运行的安全与可控”。
我们在项目里把“能上线”的最低标准收敛成三件事:
1. 必须有沙箱与权限边界
沙箱不是简单的一句话,它至少要回答这些边界:
- Agent 能访问哪些系统?能写哪些字段?
- 写操作如何分级?(只读/建议/需审批/自动执行)
- 费用与速率如何限制?(避免失控调用)
- 敏感数据如何脱敏与隔离?
2. 必须有可观测性与行为日志
我们建议把日志当作产品的一部分:
- 每次任务的输入、检索、工具调用、输出
- 每步耗时、token/cost、成功率
- 失败原因分类(权限/接口/数据缺失/模型不确定/业务规则冲突)
- 能回放(Replay),能对照(A/B),能审计(Audit)
3. 必须有失败路径与回滚策略
“不确定系统”的常态是失败。关键不是避免失败,而是:
- 失败时如何中断?如何让人接管?
- 写操作如何补偿与幂等?如何撤销?
- 哪些场景必须“人审”才能继续?
如果这些基础不在,Agent 一旦出问题,排查成本会迅速高于它带来的收益。
05
我们为什么一直在“打地基”
很多人会问:为什么不直接追逐最热门的 Agent 产品原型?
因为在我们深度参与从产品搭建到系统演进的全过程中,一个结论愈发清晰:
在复杂业务里决定长期成败的,是最后托底的基础设施。
我们的实践反复印证了这一点:无论是在应用层尝试构建智能触点,在数据层梳理混乱的资产,还是在 AI 层寻求增长转化,所有看似前沿的探索,其成败的临界点都落回同一个问题——
是否具备一个为“不确定性”而设计的、闭环的基础设施层。

换句话说,在 Agent 时代真正降临之前,需要一片坚实而智能的土壤。
这片土壤,由两条必须协同前进的「腿」共同支撑:
一条是稳健的“左腿”——数据与数据基础设施;
另一条是灵活的“右腿”——模型与智能 Agent。
企业若想真正让AI应用奔跑起来,而非蹒跚学步,二者缺一不可。
因此,我们将资源持续投入于基础设施的构建。
这并非出于对热点的回避,而是因为在复杂的业务系统中,我们清晰地看到:
唯有当地基足够深厚、反馈链路足够健全时,上层建筑的智能才有意义,也才能真正创造可持续的价值。
06
写在最后
Agent 必将成为主角。
但在帷幕升起之前,构筑那座让主角能够稳步登场的舞台,是一项同样重要、甚至更为迫切的工作。
AI Infra 决定了这场技术变革的下限与边界。
而我们,选择从这里开始。


