文章

持续沉淀可被搜索、可被引用、可长期复用的内容。共 172 篇,第 16 / 18 页。

  • 本文系统拆解 Prefix-Aware KV Cache Routing 的生产工程价值,从 prefix caching、KV cache block hash、worker 路由、跨节点缓存复用、租户隔离到 SLO 监控,帮助团队减少重复 prefill、降低 TTFT,并避免缓存热点与安全风险。

  • 本文系统拆解 LLM 量化的生产工程逻辑,从 AWQ、GPTQ、SmoothQuant、FP8、INT4、KV cache 量化、校准数据、硬件 kernel 到质量回归测试,帮助团队判断大模型推理降本时如何在显存、延迟、吞吐和准确率之间做可靠取舍。

  • 系统拆解 AI Agent 可观测性工程,从 OpenTelemetry GenAI semantic conventions、LLM trace、tool call span、retrieval evidence、memory lineage 到 online evals 与 execution provenance,帮助团队定位 RAG、工具调用和长任务 Agent 的真实失败原因。

  • 本文系统拆解 Multi-LoRA Serving 的生产工程价值,从 LoRA adapter、共享 base model、动态加载、GPU 缓存、异构 rank、请求路由、租户隔离到 SLO 监控,帮助团队用更低成本部署大规模定制化 LLM 服务。

  • 本文系统拆解 Prompt Caching 在生产级 LLM Agent 中的工程价值,从稳定前缀、cache breakpoint、工具 schema、动态上下文、TTFT、缓存命中指标到质量回归测试,帮助团队把提示词缓存从 API 功能做成可观测、可版本化的成本与延迟优化体系。

  • 系统拆解 LLM Model Routing 的生产工程价值,覆盖强弱模型路由、级联调用、质量评估、成本预算、延迟 SLO、Provider 回退与对抗路由风险,帮助团队建立可观测、可回退、可评估的大模型调用中间层。

  • 从 MCP 官方规范、OWASP、OpenAI、NSA 与安全研究出发,系统拆解 AI Agent 工具接入中的 tool poisoning、间接 prompt injection、权限控制、动作审查、沙箱执行与审计回归,帮助团队构建可上线的 MCP Agent 安全架构。

  • 本文系统拆解生产级 RAG 的检索质量工程,从文档解析、结构化分块、BM25 与向量混合检索、重排、证据压缩到 RAG 评估指标,帮助团队减少幻觉、提升答案可追溯性与系统稳定性。

  • 本文系统拆解 LLM-as-a-Judge 的工程价值、G-Eval、pointwise 与 pairwise 评测、position bias、verbosity bias、self-preference、人工校准和 CI 回归测试,帮助团队建立可追踪、可校准、可上线的 LLM 自动评测体系。