别让 Agent 把需求写成一团散文:Yamlet 用可验证规格把实现前的分歧提前暴露
让编码 Agent 接手一个功能时,最昂贵的返工往往不是它把某行代码写错了,而是它从一段看似完整的自然语言里选中了错误的解释。比如“上传文件后发送邮件”这句话,究竟要限制格式吗?失败后是否重试?收件人...
最新内容
让编码 Agent 接手一个功能时,最昂贵的返工往往不是它把某行代码写错了,而是它从一段看似完整的自然语言里选中了错误的解释。比如“上传文件后发送邮件”这句话,究竟要限制格式吗?失败后是否重试?收件人...
给 Agent 补单元测试并不等于验证它能在真实故障里恢复。一次工具调用可能超时,模型端可能返回截断 JSON,网络重试又可能把写操作做两遍;MCP 服务还会带来 schema 演进、权限失败和有副作...
让编码 Agent 生成演示文稿,最常见的失败并不是“内容写得不够漂亮”,而是产物不可审查。.pptx 本质是一组体积不小的 XML 与媒体文件:人类可以在 PowerPoint 里拖拽修正,模型却难...
团队同时使用 Claude Code、Codex 和 Gemini CLI 时,真正难管的通常不是某一次提示词,而是工程边界:不同成员装了不同版本;MCP 服务要重复配置;一次任务里的研究、实现和测试...
AI 编码 Agent 做到第十几轮以后,问题往往不是模型突然变笨,而是会话状态开始失控:为了保留此前的决策、命令输出和失败线索,客户端反复携带越来越长的历史;为了压低输入量,又有人在 system ...
让 AI Agent 查询业务数据,最危险的误解是:只要模型“遵守提示词”,就能把数据库访问权交出去。提示词注入、错误推理和蓄意的多轮试探都会打破这个前提。即使每次只允许它执行看似无害的聚合查询,攻击...
AI 编码工具的账单很容易制造一种错觉:本月花了多少、某个模型占多少,看起来已经足够管理成本。但对开发团队来说,真正要回答的并不是“总共烧了多少 token”,而是“哪些已经合并的变更值得这笔钱”“哪...
排查一条来自公网的异常请求时,日志通常只给出 IP:8.8.8.8、203.0.113.x 或一串反向代理转发链。单独看地址,很难决定它该进入哪条处理路径:这是公司云出口、已知 CDN、某个普通运营商...
让 Claude Code、Codex 一类编码 Agent 直接操作真实项目,效率往往来自它们拥有和开发者相同的权限:能改代码、运行脚本、读配置、删除生成文件。风险也在同一处。一次错误的“清理”、不...
让编码 Agent 改一个按钮颜色、补一个表单校验,最常见的交付证据仍是“已完成”或一张截图。问题不在于截图没有价值,而在于它通常不能回答三个工程问题:当前页面是否真加载了新代码?某个交互后的状态是否...