工作流比模型更接近结果
过去我们习惯把 AI 理解成一个回答问题的窗口。现在,它开始接过一段完整的工作:读取上下文、使用工具、检查结果,再根据失败继续调整。
这意味着评价标准也在改变。答案是否漂亮不再是唯一问题,更重要的是:事情有没有真的完成。
从一次回答到一个闭环
一个可靠的 Agent 工作流,至少包含三件事:
- 清楚的完成标准
- 能够接触真实环境的工具
- 在交付之前主动验证
如果缺少其中任何一项,所谓的自动化通常只是把不确定性移到了更远的地方。
模型负责提出下一步,工作流负责让下一步变得可检查。
人的角色没有消失
人的价值正在从“亲手执行每一步”,转向定义边界、判断取舍和设计反馈。最好的协作不是把所有事情交出去,而是让机器承担可以被验证的部分,把注意力留给真正需要判断的地方。
一个更实用的问题
与其问“这个模型有多强”,不如问:
它能否在我的真实环境里,稳定完成一个有明确终点的任务?
这个问题会把讨论从演示带回工作本身。