四十秒的任务撞上三十秒的超时 8 月 11 号,我们的工单自动处理 Agent 上线一周后,监控上出现一条难看的曲线:任务失败率 4.7%,失败原因几乎全是 UpstreamTimeout。 查了一下,原因很直白——这个 Agent 平均执行 11 秒,但 P99 是 41 秒。而我们网关的超时是
订单系统里,一个下单成功事件要同时触发:发短信、更新统计、同步搜索索引、通知风控。一开始我用 @TransactionalEventListener 在一个方法里全干了,结果短信接口抖一下,整个下单事务被拖慢。这种"一个事件多个消费者"的场景,正是 Spring Integration 的主场。 消
下单接口越来越慢 createOrder 接口 RT 一度到了 800ms,点进去一看,主链路里塞了发短信、记风控、推积分三件"顺带"的事。它们慢一点,用户下单就卡一下。最糟的是,积分服务抖动时连下单都失败了,核心链路被旁路拖死。监控里下单 RT 的 P99 曲线和积分服务的 RT 曲线几乎同涨同落