MCP Tool Poisoning 实战:为 LLM Agent 建立工具调用安全边界
系统拆解 MCP 工具投毒与间接提示注入风险,从工具注册、最小权限、参数审计、内容隔离到运行时拦截,给出可落地的五层防御架构与上线检查清单,帮助接入外部 API、数据库和企业系统的团队建立可审计的 Agent 安全边界。
持续沉淀可被搜索、可被引用、可长期复用的内容。共 172 篇,第 13 / 18 页。
系统拆解 MCP 工具投毒与间接提示注入风险,从工具注册、最小权限、参数审计、内容隔离到运行时拦截,给出可落地的五层防御架构与上线检查清单,帮助接入外部 API、数据库和企业系统的团队建立可审计的 Agent 安全边界。
本文系统讲解 Prefix Caching 如何复用共享提示词与上下文的 KV Cache,降低 RAG、Agent 和长文档问答场景的 TTFT、推理成本与重复预填充开销,并给出 vLLM、OpenAI API、SGLang 的工程落地清单与常见误区。
本文系统讲解 Structured Outputs 与 Constrained Decoding 的核心原理、Schema 设计、服务端接入、性能成本、异常处理、上线检查与常见误区,帮助 LLM 应用稳定生成可解析 JSON。
从短期会话到长期记忆,系统拆解 LLM Agent 的写入、整理、读取、遗忘与评估机制,帮助团队避免把记忆层做成不可控的向量库堆料,打造可生产落地的 Agent 记忆系统。
系统讲解 Contextual Retrieval 的原理、索引改造、混合检索、重排与上线检查,帮助工程团队降低 RAG 漏召回并提升答案可追溯性。
从推理服务视角深入拆解 Speculative Decoding 的草稿生成、并行校验、接受率与上线指标,系统对比 Draft Model、Medusa、EAGLE 等主流方案,结合灰度验证与回滚清单,帮助 LLM 工程团队将投机解码从论文技巧落地为稳定的生产优化手段。
本文围绕多模型路由的生产落地展开,解释路由信号、评估闭环、成本预算、回退策略与上线检查,帮助团队在质量、延迟和费用之间建立可验证、可回滚、可观测的动态模型选择机制。
本文从注意力沉降现象出发,解释 StreamingLLM 如何保留初始 Sink Token 与最近窗口,在不微调模型的前提下降低长会话显存压力,并给出生产落地边界、监控指标与上线检查清单。
本文从 LLM-as-a-Judge 的评分模式、Rubric 设计、偏差来源、线上回归、人工复核与阈值治理出发,整理一套适合 RAG、Agent 和内容生成系统的生产级评测闭环。
围绕大模型 Agent 线上治理,拆解 Trace、Span、评估器、采样、脱敏、回放与告警如何协同,帮助团队从日志排障升级为可复现、可审计、可持续改进的质量工程。