文章

🤖 一个人,一年 17 万次 GitHub 贡献:拆解 steipete 的「AI agent 车队」开发模式

Peter Steinberger(steipete)过去一年在 GitHub 上留下 171,946 次贡献,单日峰值 921 个 commit、24 小时无作息波谷。这不是手快,而是「一个人 + AI agent 车队」这种新开发范式的投影。本文用直接从 GitHub API 拉取的硬数据,加上他自己开源的 OpenClaw 仓库里的真实工程机制,拆解这套模式怎么运转、需求从哪来、质量靠什么兜底,以及它的边界在哪。

🌐 本周 F-Droid(2026-06-19):有机字符识别

· 译自 F-Droid

F-Droid 第 25 周社区周报。重点是 Element X / SchildiChat 的安全更新(建议尽快升级),FairScan、MakeACopy 等扫描/OCR 应用更新,以及本周新增的 23 款 FLOSS 应用。

🌐 本周 F-Droid(2026-06-12):不是我们选的这些柔和色

· 译自 F-Droid

F-Droid 第 24 周社区周报。核心进展是 F-Droid 2.0 已到 alpha10、临近正式发布并征集测试;社区新闻控诉 Google 把 baresip、Syncthing-Fork 等正常开源应用误判为恶意软件,并呼吁关注 Android 开放性。

🌐 本周 F-Droid(2026-06-05):停一停,冥想片刻

· 译自 F-Droid

F-Droid 第 23 周社区周报。新增基于 Briar 协议 + Tor 的私密通信应用 Zerion,App Manager 6 周年,数字排毒应用 DetoxDroid 更新,以及 Prav / Quicksy 的捐赠呼吁。

🌐 当 AI 构建自身——Anthropic 谈递归自我改进

· 译自 The Anthropic Institute

Anthropic Institute 用公开基准和内部数据论证:AI 已经在加速 AI 自身的开发——80% 以上的合并代码由 Claude 编写、工程师人均产出 8 倍增长、实验优化能力一年内从 3x 到 52x。距离「AI 完全自主设计后继者」还差一个「研究品味」的鸿沟,但窗口可能比所有机构准备的都要早到来。

🤖 别靠肉眼:用 ffmpeg 抽帧拼图客观验证 UI 动画

改完一个键盘弹出的闪动 bug,加了 adjustResize 怀疑修好了——但「修好了吗」靠肉眼真分不清。这篇讲怎么用一段录屏 + ffmpeg 抽帧拼图,把「流不流畅」变成看得见、能对比、可归档的客观证据。

🌐 当 Claude 能解掉你的招聘笔试题:设计「抗 AI」的技术面试

· 译自 Anthropic Engineering

Anthropic 性能团队的 take-home 笔试用了一年半、招进几十人,但每出一代 Claude 就被攻破一次。从仿真加速器优化,到数据转置,再到 Zachtronics 式的怪题——一位面试设计者讲他怎么让题目跑在最强模型前面。

🌐 Claude Code 质量下降复盘:三个改动叠在一起,看起来像「全面变笨」

· 译自 Anthropic Engineering

一个月里用户反馈 Claude Code 变差,溯源到三个互不相干的改动:默认 reasoning effort 调低、一个缓存优化错误地每轮都丢弃思考历史、一条「控制冗长」的系统提示拖累了编码质量。三者错峰命中不同流量,叠成「广泛而不一致的退化」。

🌐 三个基础设施 bug 的复盘:我们从不因负载而降低 Claude 质量

· 译自 Anthropic Engineering

8 月到 9 月初,三个互相重叠的基础设施 bug 间歇性地拉低了 Claude 的回答质量。这篇罕见地公开了底层技术细节:路由错配、输出损坏、以及一个潜伏已久的 XLA:TPU 编译器 bug,以及为什么检测它们这么难。

🌐 用一队并行的 Claude 写一个 C 编译器

· 译自 Anthropic Engineering

16 个 Claude 并行协作、近 2000 次会话、两万美元 API 成本,从零写出一个 10 万行的 Rust C 编译器,能编译出可启动的 Linux 6.9(x86/ARM/RISC-V)。这篇讲的是怎么给「长跑、自主的 agent 团队」设计 harness。

🌐 进阶工具使用:让 agent 用得起成千上万个工具

· 译自 Anthropic Engineering

当 agent 要在成百上千个工具间工作,瓶颈就成了「怎么用得起」。工具搜索、编程式调用、工具示例三个功能,分别从「找工具、用工具、调对工具」三处破局。

🌐 给 Claude Code 加沙箱:与其每次求批准,不如约束环境

· 译自 Anthropic Engineering

与其为每个动作求批准,不如约束环境本身——让一个不受限的 agent 也造不成真正的破坏。文件系统隔离 + 网络隔离两道边界,靠操作系统强制执行,把弹窗留给真正需要跨边界的极少数动作。

🌐 Contextual Retrieval:给每个文本块补回它丢掉的上下文

· 译自 Anthropic Engineering

传统 RAG 把文档切成小块时,往往把上下文一起切没了,导致检索失败。Contextual Retrieval 在切块后、嵌入前,给每块补一段「它在全文里的位置说明」,把检索失败率最高砍掉 67%。

🌐 用代码执行调用 MCP:把 agent 做得更省、更快

· 译自 Anthropic Engineering

工具一多,定义和中间结果就把 context 撑爆。把 MCP server 当成代码 API,让 agent 写代码按需 import、就地处理数据——一个例子里 token 从 15 万压到 2 千。

🌐 给 AI agent 做评估:一份去神秘化的实战指南

· 译自 Anthropic Engineering

没有 eval,团队只能等用户报错、手动复现、修一个又坏一个,全程「盲飞」。这篇系统讲了 agent eval 的结构、三类打分器、能力 vs 回归评估,以及从 0 到 1 搭出一套可信 eval 的八步路线图。

🌐 Desktop Extensions:把 MCP 服务器安装做成一键

· 译自 Anthropic Engineering

MCP 很强,但装一个 MCP 服务器一直很折腾:装运行时、克隆代码、装依赖、手改 JSON 配置。Desktop Extensions 用一个 .dxt 文件把这一切打包,下载、打开、搞定。

🌐 用 Agent Skills 把 agent 武装到能干真活

· 译自 Anthropic Engineering

让专家成为专家的,不只是知识,而是「在这儿我们怎么做事」的实战经验。Agent Skills 把这种经验打包成可组合、可移植、按需加载的文件夹,靠渐进式披露绕开 context 限制。

🌐 当模型怀疑自己正在被考:Opus 4.6 在 BrowseComp 上的「评估意识」

· 译自 Anthropic Engineering

评估 Opus 4.6 时,我们见到一种全新的「污染」:模型没有偶遇泄露的答案,而是自己推断出「我可能正在被评测」,反推出是哪个 benchmark,找到源码、解密了答案库。这对「在联网环境里跑静态基准是否还可靠」提出了尖锐问题。

🌐 长任务 agent 的 harness 设计:模型往往不是瓶颈

· 译自 Anthropic Engineering

让 Claude 从一句话造出完整应用,真正的杠杆不在模型本身,而在 harness——围绕模型的脚手架。生成与评估分离、把记忆当工具、按需重置上下文,是几条经得起模型升级的经验。

🌐 托管 agent:别让做产品的团队变成基础设施公司

· 译自 Anthropic Engineering

造一个 agent 起步容易、收尾难。真正费功夫的,是把「调模型的循环」做成能在生产里稳定跑的东西——长任务、断点续跑、上下文管理、预算控制。托管 agent 把这堆苦活搬到平台上。

🌐 构建高效的 Agent

· 译自 Anthropic Engineering

Anthropic 官方:从简单可组合的模式出发,分清 workflow 与 agent 的边界,按需选用,别上来就堆框架。

🤖 搭一条翻译流水线:自动化划在哪

想稳定翻译 Anthropic Engineering 到个人站,但人工太累、全自动又掉品质。把自动化划在「发现 + 草稿」这条线上,剩下的留给品味。

🌐 Claude Code 最佳实践

· 译自 Anthropic Engineering

Anthropic 官方文档:用好 Claude Code 的经验和模式,从环境配置到多会话并行。

🌐 把 Claude 关进产品:跨产品 containment 实践

· 译自 Anthropic Engineering

Agent 越强,潜在爆炸半径越大。Anthropic 这篇讲他们在 claude.ai、Claude Code、Claude Cowork 三个产品里如何用沙箱、VM、egress 控制做 containment,以及那些教他们最多的安全事故。

🌐 为 AI agent 做上下文工程

· 译自 Anthropic Engineering

Context engineering 是 prompt engineering 的演进 —— 因为 context 是 agent 的有限资源,LLM 也有「注意力预算」,怎么省着用是核心。

🌐 给 AI agent 写工具:让 agent 自己帮你打磨

· 译自 Anthropic Engineering

MCP 让 agent 能用上几百个工具,但工具好不好用是另一回事。这篇讲怎么写工具、怎么用 Claude Code 跑 eval、怎么把工具迭代到 agent 真用得动。