文章

持续沉淀可被搜索、可被引用、可长期复用的内容。共 172 篇,第 14 / 18 页。

  • MCP 让大模型连接工具变得统一,但也放大了权限、身份、审计与提示注入风险。本文从协议边界、授权模型、执行隔离和上线检查出发,整理一套可落地的 MCP Tool Server 安全治理方案。

  • MoE模型推理服务中,Expert Parallelism如何影响通信开销与负载均衡?本文从真实瓶颈出发,系统梳理EP工作机制、All-to-All通信、并行策略组合、跨节点部署与上线检查清单,帮助工程师在生产环境中高效部署稀疏大模型。

  • 本文从连续批处理与预填充分块的协同机制出发,深入解析长上下文推理中如何通过 Chunked Prefill 治理延迟,涵盖核心调度原理、chunk size 调参策略、工程落地指标与生产上线检查清单。

  • 深入解析 Prompt Caching 的核心原理与工程实践,从前缀稳定性、缓存边界到 Agent 场景落地,提供可复现的优化方案与生产检查清单,帮助团队在不改变模型语义的前提下显著降低输入成本与首字延迟。

  • KV Cache 复用正在成为长上下文大模型服务的核心优化点。本文从 Prefix Caching、RadixAttention 到多级 Offloading,系统梳理命中率、延迟、成本与上线检查方法,帮助团队在同样 GPU 预算下承载更多请求。