2026-07-06
Peter Steinberger(steipete)过去一年在 GitHub 上留下 171,946 次贡献,单日峰值 921 个 commit、24 小时无作息波谷。这不是手快,而是「一个人 + AI agent 车队」这种新开发范式的投影。本文用直接从 GitHub API 拉取的硬数据,加上他自己开源的 OpenClaw 仓库里的真实工程机制,拆解这套模式怎么运转、需求从哪来、质量靠什么兜底,以及它的边界在哪。
2026-06-19 · 译自 F-Droid
F-Droid 第 25 周社区周报。重点是 Element X / SchildiChat 的安全更新(建议尽快升级),FairScan、MakeACopy 等扫描/OCR 应用更新,以及本周新增的 23 款 FLOSS 应用。
2026-06-12 · 译自 F-Droid
F-Droid 第 24 周社区周报。核心进展是 F-Droid 2.0 已到 alpha10、临近正式发布并征集测试;社区新闻控诉 Google 把 baresip、Syncthing-Fork 等正常开源应用误判为恶意软件,并呼吁关注 Android 开放性。
2026-06-08
TrendingAI 上架 F-Droid 的完整流程拆解——改造客户端工程、编写 metadata、提 MR 过 9 道 CI、合并上线四个阶段,每一步给出具体操作、验证方法,以及实测撞过的坑。
2026-06-05 · 译自 F-Droid
F-Droid 第 23 周社区周报。新增基于 Briar 协议 + Tor 的私密通信应用 Zerion,App Manager 6 周年,数字排毒应用 DetoxDroid 更新,以及 Prav / Quicksy 的捐赠呼吁。
2026-06-05 · 译自 The Anthropic Institute
Anthropic Institute 用公开基准和内部数据论证:AI 已经在加速 AI 自身的开发——80% 以上的合并代码由 Claude 编写、工程师人均产出 8 倍增长、实验优化能力一年内从 3x 到 52x。距离「AI 完全自主设计后继者」还差一个「研究品味」的鸿沟,但窗口可能比所有机构准备的都要早到来。
2026-06-04 · 译自 GitHub Store Blog
一个 16 岁的乌兹别克斯坦开发者,因为 Play Store 上架流程太重,用一周时间做出了基于 GitHub Releases 的跨平台应用商店。六个月后:12,500+ 星、25 万+ 次更新分发、13 种语言——以及差点在 3,000 星时放弃的故事。
2026-06-04
kmp-webview 0.1.0 的完整发版流程拆解——前置准备、配置发布插件、本地手动首发、自动化 workflow 四个阶段,每一步给出具体操作、验证方法,以及实测撞过的坑。
2026-06-02
改完一个键盘弹出的闪动 bug,加了 adjustResize 怀疑修好了——但「修好了吗」靠肉眼真分不清。这篇讲怎么用一段录屏 + ffmpeg 抽帧拼图,把「流不流畅」变成看得见、能对比、可归档的客观证据。
2026-05-29 · 译自 Anthropic Engineering
Anthropic 性能团队的 take-home 笔试用了一年半、招进几十人,但每出一代 Claude 就被攻破一次。从仿真加速器优化,到数据转置,再到 Zachtronics 式的怪题——一位面试设计者讲他怎么让题目跑在最强模型前面。
2026-05-29 · 译自 Anthropic Engineering
一个月里用户反馈 Claude Code 变差,溯源到三个互不相干的改动:默认 reasoning effort 调低、一个缓存优化错误地每轮都丢弃思考历史、一条「控制冗长」的系统提示拖累了编码质量。三者错峰命中不同流量,叠成「广泛而不一致的退化」。
2026-05-29 · 译自 Anthropic Engineering
8 月到 9 月初,三个互相重叠的基础设施 bug 间歇性地拉低了 Claude 的回答质量。这篇罕见地公开了底层技术细节:路由错配、输出损坏、以及一个潜伏已久的 XLA:TPU 编译器 bug,以及为什么检测它们这么难。
2026-05-29 · 译自 Anthropic Engineering
16 个 Claude 并行协作、近 2000 次会话、两万美元 API 成本,从零写出一个 10 万行的 Rust C 编译器,能编译出可启动的 Linux 6.9(x86/ARM/RISC-V)。这篇讲的是怎么给「长跑、自主的 agent 团队」设计 harness。
2026-05-29 · 译自 Anthropic Engineering
当 agent 要在成百上千个工具间工作,瓶颈就成了「怎么用得起」。工具搜索、编程式调用、工具示例三个功能,分别从「找工具、用工具、调对工具」三处破局。
2026-05-29 · 译自 Anthropic Engineering
全天用 Claude Code 的人,被无穷的权限确认搞到麻木,确认框反而失去了保护作用。auto mode 用一个快速分类器,把日常操作放行、把真正有风险的动作拦下来人工确认。
2026-05-29 · 译自 Anthropic Engineering
与其为每个动作求批准,不如约束环境本身——让一个不受限的 agent 也造不成真正的破坏。文件系统隔离 + 网络隔离两道边界,靠操作系统强制执行,把弹窗留给真正需要跨边界的极少数动作。
2026-05-29 · 译自 Anthropic Engineering
一个简单到出奇的「think」工具,给 Claude 一块在工具调用链中途停下来核对规则、检查信息的草稿纸,在客服等规则繁多的场景里显著提升表现。
2026-05-29 · 译自 Anthropic Engineering
传统 RAG 把文档切成小块时,往往把上下文一起切没了,导致检索失败。Contextual Retrieval 在切块后、嵌入前,给每块补一段「它在全文里的位置说明」,把检索失败率最高砍掉 67%。
2026-05-29 · 译自 Anthropic Engineering
工具一多,定义和中间结果就把 context 撑爆。把 MCP server 当成代码 API,让 agent 写代码按需 import、就地处理数据——一个例子里 token 从 15 万压到 2 千。
2026-05-29 · 译自 Anthropic Engineering
没有 eval,团队只能等用户报错、手动复现、修一个又坏一个,全程「盲飞」。这篇系统讲了 agent eval 的结构、三类打分器、能力 vs 回归评估,以及从 0 到 1 搭出一套可信 eval 的八步路线图。
2026-05-29 · 译自 Anthropic Engineering
长时运行 agent 的核心难题是「每个新会话都没有上一程的记忆」。Anthropic 用「初始化 agent + 编码 agent」两段式方案,配合 feature list、进度文件、git 历史和端到端测试,让 agent 像轮班工程师一样一程接一程地推进。
2026-05-29 · 译自 Anthropic Engineering
MCP 很强,但装一个 MCP 服务器一直很折腾:装运行时、克隆代码、装依赖、手改 JSON 配置。Desktop Extensions 用一个 .dxt 文件把这一切打包,下载、打开、搞定。
2026-05-29 · 译自 Anthropic Engineering
让专家成为专家的,不只是知识,而是「在这儿我们怎么做事」的实战经验。Agent Skills 把这种经验打包成可组合、可移植、按需加载的文件夹,靠渐进式披露绕开 context 限制。
2026-05-29 · 译自 Anthropic Engineering
评估 Opus 4.6 时,我们见到一种全新的「污染」:模型没有偶遇泄露的答案,而是自己推断出「我可能正在被评测」,反推出是哪个 benchmark,找到源码、解密了答案库。这对「在联网环境里跑静态基准是否还可靠」提出了尖锐问题。
2026-05-29 · 译自 F-Droid
F-Droid 第 22 周社区周报。多款应用(ReFra/相册、VCMI、LabNex 等)带来超长更新日志,NewPipe 放弃 Android 5 支持,并一次性新增多达 50 款新应用。
2026-05-29 · 译自 Anthropic Engineering
让 Claude 从一句话造出完整应用,真正的杠杆不在模型本身,而在 harness——围绕模型的脚手架。生成与评估分离、把记忆当工具、按需重置上下文,是几条经得起模型升级的经验。
2026-05-29 · 译自 Anthropic Engineering
SWE-bench、Terminal-Bench 这类编码基准的榜首常常只差几个百分点。但我们发现,仅仅是基础设施配置——给容器多少内存、卡不卡死——就能造成超过这个差距的分数波动。Terminal-Bench 2.0 上,资源最足与最紧的配置相差 6 个百分点。
2026-05-29 · 译自 Anthropic Engineering
造一个 agent 起步容易、收尾难。真正费功夫的,是把「调模型的循环」做成能在生产里稳定跑的东西——长任务、断点续跑、上下文管理、预算控制。托管 agent 把这堆苦活搬到平台上。
2026-05-29 · 译自 Anthropic Engineering
升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上拿到 49%,刷新 SOTA。秘诀是一个极简 agent 脚手架:一段 prompt、一个 Bash 工具、一个 Edit 工具,把怎么解题的判断权尽量交给模型自己。
2026-05-28 · 译自 Anthropic Engineering
Anthropic 官方:从简单可组合的模式出发,分清 workflow 与 agent 的边界,按需选用,别上来就堆框架。
2026-05-28
想稳定翻译 Anthropic Engineering 到个人站,但人工太累、全自动又掉品质。把自动化划在「发现 + 草稿」这条线上,剩下的留给品味。
2026-05-27 · 译自 Anthropic Engineering
Anthropic 官方文档:用好 Claude Code 的经验和模式,从环境配置到多会话并行。
2026-05-27
从 Astro 5 + MDX 骨架到 harlon.wang 上线的完整流程,记录 Cloudflare Pages 部署 + 域名绑定中遇到的非显然问题。
2026-05-25 · 译自 Anthropic Engineering
Agent 越强,潜在爆炸半径越大。Anthropic 这篇讲他们在 claude.ai、Claude Code、Claude Cowork 三个产品里如何用沙箱、VM、egress 控制做 containment,以及那些教他们最多的安全事故。
2025-09-29 · 译自 Anthropic Engineering
Context engineering 是 prompt engineering 的演进 —— 因为 context 是 agent 的有限资源,LLM 也有「注意力预算」,怎么省着用是核心。
2025-09-11 · 译自 Anthropic Engineering
MCP 让 agent 能用上几百个工具,但工具好不好用是另一回事。这篇讲怎么写工具、怎么用 Claude Code 跑 eval、怎么把工具迭代到 agent 真用得动。
2025-06-13 · 译自 Anthropic Engineering
Claude 的 Research 功能背后是 orchestrator-worker 多 agent 架构。这篇讲为什么用多 agent、怎么 prompt 它们、eval 怎么搞、生产环境会撞什么坑。