八月的 GPU 账单让我坐不住了 我们自建的推理集群,8 台 A100 80G,7 月的账单是 ¥41.6 万。同时监控告诉我另一个数字:GPU 利用率平均 31%。 花了钱,卡在空转。这两件事放一起,不优化说不过去。 这篇是过去五周做的事。缓存、量化、批处理三块,全会上线后的结果是:单卡吞吐从 2
一条一星评价 8 月 6 号早上,应用商店来了条新评价,一星: 用了半个月,每次都要重新介绍一遍我的情况。上周让它记住的偏好,这周又忘了。同一家公司的人问同一个问题,答案还不一样,无语。 第二条倒是我们有意为之(不同角色权限不同),第一条是实打实的问题。 这篇记录我们做 Agent 记忆持久化的过程
三个人吵了两周,我算了一笔账 7 月初,团队为"新项目用哪个 Java AI 框架"吵了两周。三个人,三种意见,各自写了 demo,各自的 benchmark 都证明自己选的更好。 我做了件不太受欢迎的事:把这两周的成本算了出来。 参与讨论:3 人 × 14 天 × 60% 投入 ≈ 25 人日 写
为什么开始看 AgentScope Java 我们团队的主力框架是 Spring AI 2.0,用了快一年。真正让我开始评估 AgentScope Java 2.0 的,是 6 月底一次多 Agent 协作的需求。 需求本身不复杂:一个"故障分析"场景,需要日志分析 Agent、代码检索 Agent
财务对账发现两笔一模一样的退款 7 月 2 日上午,财务在群里贴了两行流水: 2026-07-01 22:14:07 RF2026070122140701 SO20260628009 -12,900.00 成功 2026-07-01 22:14:09 RF2026070122140903
红队测试甩过来一张截图 6 月中旬,安全组在我们客服 Agent 上做了一轮红队测试。第二天他们丢过来一段对话记录,最后一句模型输出是一串完整的身份证号——那是用户第一轮就提供的、我们已经脱敏过的号码。 我们的敏感词库有 12,800 条规则,身份证正则也在里面。为什么没拦住? 这篇记录我们随后两周
「让运维 Agent 自己去问数据库 Agent」 四月份我们遇到一个需求:客服 Agent 在处理客诉时,需要判断「这个订单的物流是不是真的延误了」。这个判断需要的权限(查物流商内部系统、看历史延误率)我们不打算给客服 Agent。 常规解法是加一个工具。但那意味着把物流系统的权限开放出去,而且物
「客户 A 能看到客户 B 的知识库内容」 三月份的一次安全测试,外部团队提了一个问题:他们用 A 公司的账号登录后,通过构造特定的查询,让 Agent 返回了 B 公司的产品文档片段。 这个问题很严重,我们当天就成立了专项。这篇记录多租户隔离的四层设计、每一层我们实际用的方案,以及成本计量那块(这
长连接撑不住了,我们花了三周做无状态化 我们最早那版 MCP Server 用的是 SSE 传输,从 2025 年 6 月跑到现在。四月份开始出问题:Agent 数量从 3 个涨到 11 个,MCP Server 的连接数冲到 4,000+,然后就是各种诡异的断连和内存上涨。 三月份决定做无状态化改
业务方要的是「全自动」,我们给的是「半自动」 去年 12 月的评审会上,业务方提了一个需求:做一个能自动处理客诉的 Agent,从接到投诉到给出解决方案、执行补偿、发送通知,全链路不需要人。 我们的答复是:可以做,但要分阶段,且第一阶段必须有人工确认。对方不太满意,觉得我们在保守。这场会开了两个小时