下午五点,CI 报了一条失败:test_order_total_rounding 预期得到 19.99,实际得到 20.00。你把任务交给编码 Agent,它很快读了测试、改了一个金额计算函数、又跑了一遍测试。结果第一条测试过了,另外两条折扣测试开始失败。
这时最常见的处理方式,是把报错继续塞回同一 ...
一块 GPU 收到一批文本,先把它们变成数字,再做许多次矩阵乘法。模型猜下一个 Token,系统算出它猜得有多差,随后沿着计算图反向追责,把数千亿乃至上万亿个参数中的一部分轻轻推一下。这个动作会重复几百万次。
把这句话放大,就是大模型预训练。
可真正把训练规模推到万亿参数和十万亿 Token 时,问 ...
本文承接系列(一)和系列(二)。上一篇收尾时我计划先接入 SQLite,但写到这里时发现,持久化之前还要先分清一件事:哪些历史应该留下,哪些只是一次查找过程。子 Agent 恰好把这个边界讲清楚。下一篇会先实现逐条追加的会话存储,再讨论何时需要 SQLite。
子 Agent 解决的不是“更聪明 ...
本文基于 xAI 开源仓库 xai-org/grok-build 的 2026-07-16 master 快照(原始拆解所记录的 commit 为 c68e39f)撰写。它是从内部 monorepo 周期性同步出来的镜像仓库,采用 Apache-2.0 许可证,不接收外部 PR。代码和产 ...
本文承接系列(一)。上一篇的目标是做出一个安全、可理解的最小 Agent:模型决定是否调用工具,工具结果回到模型,直到它给出回答。这一篇只把这条循环补成更可靠的版本,不会假装已经实现了完整的生产系统。
这一篇解决什么问题最小循环能跑起来,但它仍有几个会在真实使用中暴露的问题:
模型调用工具后, ...
关于本教程: 这是「从零构建 Agent 框架」系列的第一篇。实现思路参考 czl9707/build-your-own-openclaw 的前两步,但代码由我重新组织为一个带工作目录限制的最小示例。它适合用来学习循环和工具调用,不是生产环境的安全方案。
很多 Agent 框架看起来很 ...
很多人学提示词工程,是从收集几条万能句式开始的:「请一步一步思考」、「你是资深专家」、「务必准确」。它们偶尔有用,于是人很自然地继续往系统提示里堆补丁。一个月以后,那段 Prompt 变成两千行:有人加过一条防止模型乱答的禁令,有人从产品网页复制了一段政策,有人为了压低人工转接率写了句「除非万不得已 ...
核验范围: 本文以 earendil-works/pi 2026 年 7 月的公开仓库和文档为依据。Pi 是 TypeScript 开源项目,采用 MIT 许可证。文中把公开文档能确认的字段、默认值、命令与我对设计取舍的理解分开写;源码和文档会迭代,具体命令、默认值与文件路径请以你安装的 ...
假设 CI 报了一条测试失败:一个金额计算函数 round_amount(2.005) 应该返回 2.01,实际返回了 2.00,这是典型的浮点精度加银行家舍入问题。把这个任务交给 Codex 后,它并不是”一次性写出一段修复代码”就完事。它需要读相关代码和测试,判断改动范围,在受限环境里运行命令, ...
假设项目里有一个登录 Bug:用户输入正确密码后仍然被重定向到登录页。你把这句话丢给 Claude Code,它要做的并不只是“生成一段修复代码”。它得先读项目结构和认证逻辑,必要时申请权限,运行测试和命令,改文件,再根据新的报错判断下一步,然后把这一切重复若干轮,直到它认为修好了。
这篇文章想做一 ...










