Agent Durable Execution 生产实战:用 Checkpoint、幂等副作用与 Replay Contract 防止长任务重复执行
长任务 Agent 恢复时最怕重复调用工具、重复写库和重复发消息。本文结合 LangGraph、Temporal 与 Microsoft Agent Framework,讲清检查点边界、幂等副作用、确定性回放与安全恢复的生产设计,给出可落地的 operation_id、side-effect ledger 与状态机方案。
共 7 篇文章
长任务 Agent 恢复时最怕重复调用工具、重复写库和重复发消息。本文结合 LangGraph、Temporal 与 Microsoft Agent Framework,讲清检查点边界、幂等副作用、确定性回放与安全恢复的生产设计,给出可落地的 operation_id、side-effect ledger 与状态机方案。
红队测试若只在上线前做一次,很快会失去价值。本文结合 PyRIT、garak 与 Promptfoo,给出攻击样本版本化、历史命中固化、扫描配置固定、评分器分层和 CI 安全门禁的完整方案,帮助 LLM 应用把每一次安全失败沉淀为可重复运行的回归资产,实现已知问题零回退。
实时语音应用的难点不只是模型准确率。本文从音频格式契约、VAD 分段策略、Partial 与 Final 状态对账、时间戳回放到真实噪声评测,系统拆解如何构建可观测、可回滚的低延迟语音识别管线,适合 LLM、生成式 AI 与实时 Agent 技术读者。
本文从 LLM-as-a-Judge 的评分模式、Rubric 设计、偏差来源、线上回归、人工复核与阈值治理出发,整理一套适合 RAG、Agent 和内容生成系统的生产级评测闭环。
长上下文和智能体请求让大模型推理瓶颈从单卡吞吐转向尾延迟治理。本文深入解析 Prefill-Decode 解耦的原理、KV Cache 传输、资源规划与上线检查清单,帮助 LLM 服务从“能跑”迈向稳定可扩展。
本文系统讲解大模型结构化输出的工程落地方法,覆盖 JSON Schema、约束解码、Schema 设计、评估指标、常见误区与上线检查,适合构建 Agent、工具调用和数据抽取流程。
系统拆解 LLM Model Routing 的生产工程价值,覆盖强弱模型路由、级联调用、质量评估、成本预算、延迟 SLO、Provider 回退与对抗路由风险,帮助团队建立可观测、可回退、可评估的大模型调用中间层。