纯 C# 追平 llama.cpp?.NET 本地推理三国杀 目录一、先看家底这不是一个量级的比赛二、三条路线三种信仰三、性能三家到底谁快四、许可证可能一票否决的那一行五、怎么选一张表说清六、写在最后如果有人告诉你纯 C# 写的大模型推理引擎性能已经追平了手工调优的 C——你会信吗这确实发生了。2026 年.NET 生态里同时出现了三个本地跑大模型的方案而且它们代表了三种完全不同的技术信仰LLamaSharp老老实实给 llama.cpp 当翻译官dotLLM不信邪从张量到 CUDA 内核全部用 C# 重写TensorSharp小孩子才做选择纯托管和原生内核我全都要我把三个仓库全部拉下来从代码量、提交记录、官方基准到许可证逐项拆了一遍。结论有点出人意料。一、先看家底这不是一个量级的比赛LLamaSharpdotLLMTensorSharp诞生时间2023 年 5 月2026 年 2 月2026 年 4 月Stars3759483281贡献者约 100 人基本 1 人基本 1 人许可证MITGPL-3.0⚠️BSD-3C# 代码量2.9 万行6.6 万行21 万行定位进程内推理库库 单机服务器完整推理平台LLamaSharp 是这里唯一久经考验的选手三年迭代到 v0.28.0百人社区还有微软 Semantic Kernel 和 Kernel MemoryRAG的官方集成包。而 dotLLM 和 TensorSharp 都是 2026 年的新生儿核心开发者都只有一个人。单人项目是这两个新引擎最大的共同风险——功能再强选型时也要把作者哪天不更新了怎么办算进去。二、三条路线三种信仰LLamaSharp借力派。它的 C# 层只有 2.9 万行代码一行内核都不写全部张量计算通过 P/Invoke 交给 llama.cpp 原生库。好处显而易见性能 llama.cpp 本身CUDA/Metal/Vulkan 全有现成后端包Install-Package就能跑。代价是能力天花板 上游能力 − 封装损耗新模型支持永远慢 llama.cpp 一步README 里那张版本映射表就是证据。dotLLM自立派。作者是《Pro .NET Memory Management》的作者、.NET MVP Konrad Kokosa。这个项目的自我定位带着一点挑衅not a wrapper around llama.cpp——分词、采样、量化矩阵乘全部纯 C#连 GPU 加速都是通过 CUDA Driver API 直接加载 PTX 内核零原生共享库依赖。这意味着它是三者中唯一能做 Native AOT 单文件分发启动约 50ms的引擎。TensorSharp合流派。作者 Zhongkai Fu 的思路很务实自研内核还嫩那就把 GGML 源码直接纳入构建体系Metal/CUDA/Vulkan 的成熟内核照用但在此之上加 llama.cpp 默认没有的东西——vLLM 式连续批处理、张量并行、跨机 TCP 集群、多模态图/视/音频、甚至文本扩散和图像编辑。21 万行 C# 16 万行 PTX体量是 dotLLM 的五倍。三、性能三家到底谁快这里有个陷阱三家的官方基准各测各的直接比数字会失真。但交叉解读后画面其实很清晰CPU 解码最常用场景dotLLM 官方对比 llama.cpp——135M 模型 0.74×、1B 模型 0.95×、3B 模型1.01×已经持平。纯托管代码在内存带宽主导的解码路径上确实追上了手工调优的 C。CPU 预填充长提示词场景dotLLM 仍是 0.32×–0.57×差距约 2-3 倍。作者很诚实直接写在文档里并给了追赶路线。GPU 吞吐TensorSharp 和 llama.cpp 在同一块 RTX 3080、同一 GGML 后端上硬碰硬——Gemma 4 预填充1.28×、首 token 延迟1.27×多轮对话最高1.49×。落后的格子Vulkan MoE 0.87×也如实列着。它的赢法不是内核更快而是调度层更聪明连续批处理 前缀共享。一句话总结水位开箱即得的绝对性能LLamaSharp ≈ TensorSharp都在跑 ggml 系内核后者高并发场景还能反超dotLLM 在 CPU 解码追平了绑定派其余场景仍在追赶——但它换来了另外两家给不了的东西零原生依赖。四、许可证可能一票否决的那一行三个项目恰好占了三个档位✅LLamaSharpMIT——随便用✅TensorSharpBSD-3——随便用⚠️dotLLMGPL-3.0——通过 NuGet 引用嵌进闭源商业产品有 copyleft 合规障碍以独立进程部署、走 HTTP API 调用则通常没问题对很多公司来说这一项就直接决定了 dotLLM 能不能进选型名单——和技术好坏无关。五、怎么选一张表说清你的情况选谁生产环境求稳要有人能问LLamaSharp已经用了 Semantic Kernel / Kernel MemoryLLamaSharp唯一官方集成闭源商用内嵌LLamaSharp 或 TensorSharp纯 CPU、零原生依赖、边缘部署、AOT 单文件dotLLM唯一选项GPU 高并发服务多用户同时请求TensorSharp连续批处理默认开启AMD/Intel 显卡、macOS MetalLLamaSharp 或 TensorSharpdotLLM 没这后端多模态、超大 MoE284B、多卡多机TensorSharp可解释性研究logit lens、激活捕获dotLLM想学怎么从零写一个推理引擎中文读者选 TensorSharp有配套书性能工程爱好者选 dotLLM求稳选 LLamaSharp求纯选 dotLLM求全选 TensorSharp。六、写在最后LLamaSharp 用三年时间证明.NET 可以借llama.cpp 的力站稳本地推理。dotLLM 和 TensorSharp 在 2026 年同时出现则说明这个社区开始提出更高的要求——部署自由度和平台化能力这恰恰是绑定路线给不了的。三家并存比任何一家独大都更能说明问题C# 在本地大模型推理这件事上已经不缺答案了。数据说明本文所有数据来自 2026-08-02 当日拉取的三仓库源码与官方文档性能数字均为各项目自报基准实际表现因硬件与负载而异选型前请自行复测。引入地址