企业售后系统里的模型可以归类工单、检索政策、起草回复,也能把一句未执行的“已退款”写得像真的。后者不是语言问题,而是系统没有把事实、权限和业务动作分开。
一套能用于售后流程的 Agent,需要明确谁可以看数据、哪些知识仍然有效、什么情况必须停下来等人、发生问题后怎样还原过程。模型只负责其中一段:根据 ...
下午五点,CI 报了一条失败:test_order_total_rounding 预期得到 19.99,实际得到 20.00。你把任务交给编码 Agent,它很快读了测试、改了一个金额计算函数、又跑了一遍测试。结果第一条测试过了,另外两条折扣测试开始失败。
这时最常见的处理方式,是把报错继续塞回同一 ...
很多人学提示词工程,是从收集几条万能句式开始的:「请一步一步思考」、「你是资深专家」、「务必准确」。它们偶尔有用,于是人很自然地继续往系统提示里堆补丁。一个月以后,那段 Prompt 变成两千行:有人加过一条防止模型乱答的禁令,有人从产品网页复制了一段政策,有人为了压低人工转接率写了句「除非万不得已 ...
让 Coding Agent 写出一段能运行的代码,已经不难。真正麻烦的是后半段:它是否理解你要解决的产品问题,是否改坏了旁边的逻辑,是否在接近真实用户的环境里跑过,是否留下了可以审查的证据,合并前有没有跟主分支冲突。
这几个问题没有一个能靠”换一个更强的模型”自动消失。模型负责提出和执行下一步,工 ...
你让 Claude Code “把这 146 份 Markdown 都翻译成英文、日文、韩文、法文和西班牙文,再检查链接和代码块”。如果只开一个会话,它当然能做,只是会很慢,而且做到第 30 个文件时,前面哪些完成、哪些失败、哪些需要重试,开始变成一团账。
多数人听到 “多 Agent” 的第一反应 ...
一、同一个能力,两个人要用我的项目里有个需求,当时把我卡住了。
系统要检索政策文件。这个能力有两个消费者:
模型。用户问「十四五规划里怎么说数字经济」,模型得自己判断该查哪个库、加什么过滤条件,然后调用。这是自主的。
图节点。产业诊断链跑到某一步,固定要去捞该县的产业材料。这是流程写死的,模型不参 ...
这篇写给两类人:一类是刚开始搭 Agent、被「上下文」这个词绕晕的初学者;一类是已经在用 LangGraph / LlamaIndex 之类框架,但总觉得「输出不稳定、模型老捡到不该看的东西」的人。我会尽量把每个术语第一次出现时讲清楚,也会给一个不依赖任何框架、30 行就能跑的最小例子 ...
一、搜什么都搜不到会议纪要库上线那天,我搜什么都搜不到。
不是结果不准,是一条都没有。0 命中。这个库里躺着五份会议记录、十几万字,向量索引建好了,检索接口通了,然后无论我问什么,它都告诉我没有。
如果你还不清楚“向量索引”“embedding”“chunk”这些词,别急,第二节会从零讲起。这一节 ...
一、同一个问题,为什么会走出两条路早期版本里,我让模型自己决定分析流程。给它工具、给它目标,让它规划下一步,这听起来很像 Agent。
后来我把同一个问题问了两次。第一次,它先做产业诊断,再查政策。第二次,它先查政策,再回头补诊断。两份结论都不离谱,却不能放在一起比较:一份把问题归因到产业结构,另一 ...
写在前面:这篇文章想解决什么我读 Hello-Agents 第四章 时,第一次把 ReAct、Plan-and-Solve、Reflection 放在一起看。它们很容易被讲成三个漂亮的流程图:一个边做边想,一个先规划,一个做完复盘。可是真正开始写 Agent,或打开 Codex、Claude Cod ...










