模型在别人的仓库里很强,在你的代码里呢?SelfBench 本地化评测实战
“这个模型在 SWE-bench 上表现很好”,并不等于它能稳定修改你的单体仓库。不同项目的构建脚本、测试习惯、领域术语和隐藏约束差异很大。SelfBench 的思路是把团队自己的合并 PR 变成评测...
最新内容
“这个模型在 SWE-bench 上表现很好”,并不等于它能稳定修改你的单体仓库。不同项目的构建脚本、测试习惯、领域术语和隐藏约束差异很大。SelfBench 的思路是把团队自己的合并 PR 变成评测...
很多浏览器 Agent 的演示都很顺:打开一个临时浏览器,搜索网页,再把结果整理出来。但一旦任务需要登录企业后台、读取已经打开的页面,或者在提交表单前让人确认,问题就出现了:Agent 使用的是另一套...
很多浏览器 Agent 的演示都很顺:打开一个临时浏览器,搜索网页,再把结果整理出来。但一旦任务需要登录企业后台、读取已经打开的页面,或者在提交表单前让人确认,问题就出现了:Agent 使用的是另一套...
当 AI 编码 Agent 能一次生成数百行代码,真正稀缺的往往不是“写出来”,而是让人快速理解:它为什么这样设计、改动影响了什么、哪些决定是 Agent 自己做的。Whiteboard 选择了一个很...
当我们谈论 AI Agent 时,最常见的画面是它在终端里修改代码、调用 API,或者在浏览器中回答问题。但很多真实工作并不发生在一个终端窗口里:打开桌面应用、填写 Excel、操作网页、整理 PDF...
当 AI 编码 Agent 能一次生成数百行代码,真正稀缺的往往不是“写出来”,而是让人快速理解:它为什么这样设计、改动影响了什么、哪些决定是 Agent 自己做的。Whiteboard 选择了一个很...
让 Claude Code 或 Codex 重构项目,最烦的并不总是模型出错,而是电脑先睡着了。合上 MacBook 盖子去喝杯咖啡,Agent 可能随之暂停;Windows 的空闲睡眠也会让一段需要...
AI 编程 Agent 的成本,往往不是一次回答决定的。它会读取文件、运行测试、分析错误、修改代码,再重复几轮;真正消耗预算的是这些连续的中间步骤。把所有请求都交给最强模型当然简单,却会让大量“读日志...
当我们谈论 AI Agent 时,最常见的画面是它在终端里修改代码、调用 API,或者在浏览器中回答问题。但很多真实工作并不发生在一个终端窗口里:打开桌面应用、填写 Excel、操作网页、整理 PDF...
很多 Agent 项目把“记忆”简化成两步:把对话切块后写入向量库,再用相似度搜索取回来。这个方案适合做演示,却很难回答生产环境最棘手的问题:这条记忆属于哪个会话?谁可以读取?删除请求是否真的删除了所...