很多人学提示词工程,是从收集几条万能句式开始的:「请一步一步思考」、「你是资深专家」、「务必准确」。它们偶尔有用,于是人很自然地继续往系统提示里堆补丁。一个月以后,那段 Prompt 变成两千行:有人加过一条防止模型乱答的禁令,有人从产品网页复制了一段政策,有人为了压低人工转接率写了句「除非万不得已 ...
核验范围: 本文以 earendil-works/pi 2026 年 7 月的公开仓库和文档为依据。Pi 是 TypeScript 开源项目,采用 MIT 许可证。文中把公开文档能确认的字段、默认值、命令与我对设计取舍的理解分开写;源码和文档会迭代,具体命令、默认值与文件路径请以你安装的 ...
假设 CI 报了一条测试失败:一个金额计算函数 round_amount(2.005) 应该返回 2.01,实际返回了 2.00,这是典型的浮点精度加银行家舍入问题。把这个任务交给 Codex 后,它并不是”一次性写出一段修复代码”就完事。它需要读相关代码和测试,判断改动范围,在受限环境里运行命令, ...
假设项目里有一个登录 Bug:用户输入正确密码后仍然被重定向到登录页。你把这句话丢给 Claude Code,它要做的并不只是“生成一段修复代码”。它得先读项目结构和认证逻辑,必要时申请权限,运行测试和命令,改文件,再根据新的报错判断下一步,然后把这一切重复若干轮,直到它认为修好了。
这篇文章想做一 ...
让 Coding Agent 写出一段能运行的代码,已经不难。真正麻烦的是后半段:它是否理解你要解决的产品问题,是否改坏了旁边的逻辑,是否在接近真实用户的环境里跑过,是否留下了可以审查的证据,合并前有没有跟主分支冲突。
这几个问题没有一个能靠”换一个更强的模型”自动消失。模型负责提出和执行下一步,工 ...
核验范围:本文以 multica-ai/andrej-karpathy-skills 的 main 分支为主要来源,阅读了 README、CLAUDE.md、Cursor Rule 和 Claude Code Skill。仓库内容、安装入口和宿主支持情况会变化,文中不会把它们写成永久事实 ...
核验范围:本文以 agentskills.io 规范页 和 anthropics/skills 仓库 的 main 分支为主要来源,重点读了规范正文、skills/pdf 目录(SKILL.md、forms.md、reference.md、scripts/)以及官方工程文章。文中给出的字 ...
核验范围:本文以 mattpocock/skills 官方仓库 的 main 分支为主要来源,阅读了 README.md、.claude-plugin/plugin.json、ADR-0002、grilling、writing-great-skills,并核对了 implement 的流 ...








