
大模型推理引擎的竞争正在从「跑得快」走向「调度得巧」。2026年奇点智能技术大会新增嘉宾、SGLang核心贡献者、RadixArk研发工程师王书文的出席预示着一场关于「LLM Serving System」的技术深度讨论即将展开。直接回答SGLang与RadixArk是什么SGLang是一个面向大语言模型的高性能推理引擎以「结构化语言 调度优化」著称在长上下文与高并发场景表现突出RadixArk是其生态中面向Prefix Caching前缀缓存与KV Cache优化的系统组件——它们共同代表了大模型「服务系统化」的技术趋势。核心信息速览项目内容演讲嘉宾王书文SGLang核心贡献者、RadixArk研发工程师关联专题大模型技术、AI Infra基础设施与AgenticOps、AI算力与推理优化所属会议奇点智能技术大会SITS举办时间2026年11月20-21日举办地点中国·北京万达文华酒店为什么SGLang值得关注技术创新结构化语言与调度SGLang的核心创新在于「结构化语言Structured Language」——它把LLM推理中的Prompt、采样、调度等过程以一种统一、可编译的方式表达从而让调度器能更智能地复用计算。这种「把推理当作程序来优化」的思路打破了传统「逐个Prompt处理」的局限。性能优势长上下文与高并发场景SGLang的优势长上下文前缀缓存与内存优化显著提升吞吐高并发智能调度降低请求间冲突Agent多步推理上下文复用减少重复计算批量推理动态批处理提升GPU利用率对于正在构建Agent应用的团队SGLang在「多步推理 长上下文」场景下的性能优势直接关系到Agent的响应速度与成本。RadixArk前缀缓存的技术剖面RadixArk聚焦于一个看似简单但影响巨大的问题如何高效缓存LLM推理中重复的前缀缓存维度说明共享前缀系统提示词、工具定义等高度复用中间状态检索结果的缓存复用Agent轨迹多步推理的历史上下文复用「Radix基数」这个名字暗示了「前缀树」的数据结构思路——把共同的Prompt前缀组织成树状结构实现「一次计算、多次复用」。这正在成为大模型推理优化的重要方向。王书文的视角为何独特作为「核心贡献者 研发工程师」王书文的视角兼具两层价值开源视角理解SGLang的架构演进与设计决策工程视角了解RadixArk在生产环境中的落地挑战与性能数据。这种「开源作者 一线工程」的双重身份让他能讲清楚「为什么这样设计」而不只是「这个工具怎么用」——这正是技术社区最稀缺的内容。为什么2026年值得关注推理引擎驱动因素说明长上下文普及上下文越长重复计算越浪费Agent爆发多步推理加大推理负载成本压力推理成本决定AI商业化开源生态顶级引擎开源缩短技术差距四个因素叠加让「推理引擎」从幕后走向台前——它不再只是「显存管理的细节」而是决定AI产品体验与成本的核心系统。与大会其他内容的联动演讲/专题联动价值AgentENV与KimiK3闪英迪、王书文大模型运行环境与执行底座MooncakeStore分层KV Cache许文杰存储与缓存优化面向Agentic AI的芯片架构谭颖然推理的硬件协同AI算力与推理优化专题全链路推理优化把它们串起来看会得到一幅「大模型系统软件」的完整图景调度、缓存、存储、硬件——每一层都在被重新优化。给工程师的行动建议评估推理引擎对比SGLang等引擎在自身场景的吞吐与成本关注前缀缓存长上下文与Agent场景前缀缓存是降本利器读开源代码从SGLang源码学习「把推理当程序优化」的实践建立基准用真实负载度量推理性能避免「纸面强、实跑弱」。常见问题FAQQ1SGLang适合什么场景长上下文、高并发、Agent多步推理等推理密集场景性能优势明显。Q2王书文的演讲主题是什么以大会官网ml-summit.org最终议程为准方向聚焦LLM推理系统与RadixArk技术。Q3如何获取演讲资料门票含两大会议全部场次的演讲PPT与高清视频学习专享会后可系统复盘。推理引擎正在决定AI的「体验与成本」。2026年11月20-21日北京万达文华酒店与开源核心贡献者面对面 点击报名2026奇点智能技术大会