从 GLiNER 到 Jev:轻量决策模型开源生态正在爆发,2026 下半年的新风口浮现 从 GLiNER 到 Jev轻量决策模型开源生态正在爆发2026 下半年的新风口浮现【免费下载链接】GLiNER2.5-Decide项目地址: https://ai.gitcode.com/hf_mirrors/fastino/GLiNER2.5-Decide如果说 2025 年的主线是 Agent 学会动手那么 2026 年下半年的暗线已经浮出水面模型开始学会判断——而且不是靠生成一段理由而是直接输出一个能驱动程序分支的概率值。这条线索在 9 月突然加速。9 月 15 日TypeSafe AI 发布决策模型 Jev两周之内社区就长出了 28 个衍生项目几乎同一时间fastino 团队的 GLiNER2.5-Decide 以 340M 参数在 17 领域基准上把 4B 级大模型甩在身后。两条看似独立的生态线正在收敛到同一个接口形态封闭选项 概率输出一次前向零 token 生成。本文结合社区舆情与 GLiNER2.5-Decide 仓库源码拆解这个正在爆发的轻量决策模型赛道。一条新赛道从会写字到会做判断先厘清 Jev 是什么。它是 TypeSafe AI 于 2026 年 9 月 15 日发布的首款 System One 模型训练方法为 RLCDReinforcement Learning for Calibrated Decisions目标是让模型报出的概率尽量贴近真实正确率。它与聊天模型截然相反不写句子只回答三类结构化答案——choice从给定选项里选、score按有序量表打分、noul给出是/否的概率。所有问题对着同一份 state工单、日志、邮件、JSON、文档片段并行评估一次往返返回程序能直接分支的值单问题延迟约 70–500 毫秒且几乎不随问题数线性爆炸。社区在抄的从来不是又一个聊天机器人而是一种新接口软件把判断权交给模型模型只在封闭选项里给概率程序自己决定怎么分支。这正是 GLiNER2.5-Decide 从 GLiNER 家族里长出来的原因——它把信息抽取时代积累的 span 匹配技术改造成了面向运营决策的专用分类器。Jev 生态 28 个项目复刻 8 个、应用 20 个接口形态是第一资产对 28 个 Jev 生态项目去重梳理后结构非常清晰8 个Open Jev复刻决策模型本身20 个应用项目把 Jev 塞进浏览器操作、Agent 基建、实时控制与数据流水线。复刻派的技术路线分化本身就是一份难得的行业标本读现成大模型分数SemIf 冻结 Qwen3.5-4B不解码任何 token只取固定选项位置的 logits 做 softmaxRTX 3090 上 21 个二元判断约 1.02 秒102 行可对齐子集一致率约 84.5%Jev 为 88.3%Simple Jev 更进一步把公共说明与 state 做成共享前缀缓存 KV每个问题只跑自己的后缀。这条路线证明接口形态可以当天复刻但概率没有按 RLCD 校准。专用编码器 决策头Laya 用 ModernBERT/mmBERT 编码 state 与选项T4 上单问题 p50 约 32.8ms比 Jev 公布的延迟快 7–8 倍但 Banking7777 个意图只有 42.5%Von 约 395M 参数以 Option-Marker 并行选项注意力一次前向同时处理 Choice/Noul/Score本地十几毫秒。改造大模型Kev 给 Qwen3.5 加决策结构Kev-9B 在新来源测试集约 83.7%Nimble 用近乎相同的两段材料、只翻转一个事实的对比训练配方把 Qwen3.5-9B 练到 90.12%逼近 Jev 的 93.21%。换一种生成物理OpenJev 用 NVIDIA 量化的 DiffusionGemma 26B-A4B 对一整块画布去噪一次填多个答案槽位格式上不可能写出 schema 以外的东西。应用派的 20 个项目则揭示了一个更重要的规律写和想归大模型判和选归决策模型执行权留在确定性代码里。从浏览器自动化jev-ultrafast 把网页编成控件表7 秒搜完 Google Flights、上下文治理fast-jev-compaction 把 18.8 万 token 会话压到 3.3 万、MCP 判断工具箱typesafe-mcp、jev-mcp到代码审查门禁Canny 的原则是事实归代码判断归 Jev只有事实能否决、模拟器闭环控制typesafe-mario 读内存打马里奥——这些项目全部共享同一个设计Agent 仍负责改文件、跑命令决策模型只提供廉价的类型化判决。GLiNER 家族的位置不为复刻接口而为重建决策本身GLiNER 家族走的是另一条更重的路。它从命名实体识别起家2025 年 7 月的 arXiv 论文2507.18546提出 GLiNER2以 schema 驱动接口在一个高效模型内统一 NER、文本分类与层级结构化抽取保持 CPU 可跑与紧凑体积。GLiNER2.5-Decide 正是这条技术线在决策场景的定向延伸。仓库源码把设计动机暴露得很彻底。打开 config.json模型类型为gliner2架构注册为Gliner2ForSchemaExtraction编码器是 24 层、hidden size 1024 的 DeBERTa-v3-large340M 参数头部采用 span 架构span_mode: markerV0、max_width: 8并配有 counting LSTM 层。而 special_tokens_map.json 中的一组结构标记——[SEP_STRUCT]、[SEP_TEXT]、[P]、[C]、[E]、[R]、[L]、[EXAMPLE]、[OUTPUT]、[DESCRIPTION]——揭示了它的工作机制标签集不是训练时固化的输出层而是作为输入的一部分被 token 化、与文本一起编码分类被建模为 span 与选项的匹配问题。这解释了它为什么能调用时传入任意标签集无需重训练。README.md 给出了完整的接口面。一次classify_text调用可以同时打分多个决策头比如邮件分诊一次拿回意图、紧急度与路由三项结论model.classify_text( From: compliancegroup.example\nSubject: Protocol update — action required today\n\nPlease confirm the new retention rule is applied before Fridays audit., { intent: [fyi, request, approval, complaint, newsletter, security_alert], urgency: [low, normal, high, critical], route: [support, billing, legal, security, finance, archive], }, ) # 输出示例{intent: request, urgency: high, route: legal}三个进阶能力则直接对齐了 Jev 生态复刻派正在攻克的两个难点多标签与阈值调控multi_label: True配合cls_threshold控制精度/召回一次抓全产品方面电池、键盘、屏幕同时命中带自然语言描述的标签labels可以携带描述如card_pin_change: The customer wants a new PIN...描述参与决策让私有分类体系在小模型上保持精确——这正是 Verdict 类项目描述参与语义思路的工程化版本序数评分把0到10作为普通字符串标签一次前向得到可排序的细粒度输出对应 Jev 的 score 能力。微调侧的差异同样关键。仓库内置了标准 JSONL 训练格式README.md 的 Fine-tuning 章节一行一个样本classifications数组里每个对象对应一个决策任务字段与classify_text完全对齐——task、labels、true_label、multi_label、prompt、label_descriptions。训练一个决策头只需from gliner2 import AutoExtractor from gliner2.training.trainer import ExtractorTrainer, TrainingConfig model AutoExtractor.from_pretrained(fastino/GLiNER2.5-Decide) config TrainingConfig(output_dirout, num_epochs3, batch_size8) ExtractorTrainer(model, config).train(train_datatrain.jsonl) tuned AutoExtractor.from_pretrained(out/final)两条生态线的活跃度与位置差异把两条生态线放在一起看差异一目了然。Jev 生态是接口爆发型两周 28 个项目热度全部集中在封闭选项 概率输出这个接口形态上复刻门槛被压到极低读 logits 当天就能跑通应用端则迅速向 Agent 基建渗透——MCP 工具、代码审查 hook、上下文治理、浏览器控制。GLiNER 家族是基准沉淀型它以统一的 fast-decisions 基准17 领域、每领域 300 条留出样本、同一文本与候选标签锚定横评坐标通过 340M / 1B / multi-Decide 的版本矩阵覆盖英文、多语言与算力差异场景靠基准数字和工程工具链说话。横评数据本身就是最有说服力的生态信号来源README.md 的 Benchmark 表fast-decisions 精确匹配准确率模型平均准确率GLiNER2.5-Decide (340M)60.2%GLiNER2.5-Decide-1B59.6%JevK557.6%GLiNER2.5-multi-Decide (287M)56.7%SemIf (Qwen3.5-4B)56.4%GLiFormer large-v149.0%Laya Router46.6%注意两个耐人寻味的点340M 版本超过了自家的 1B 版本说明这个任务栈上参数并非越多越好它同时压过了 Jev 生态里两条代表性复刻路线——读 logits 的 SemIf基座还是 4B与专用编码器的 Laya Router。考虑到 GLiNER2.5-Decide 完全本地可部署、Apache 2.0 许可、CPU 即可推理README 明确标注 Runs on: CPU or GPU这个数字的工程含义是运营决策这一细分栈专用小模型已经越过了够用门槛。社区侧的印证同样密集。CSDN 上围绕 GLiNER2.5-Decide 已出现成体系的实战内容340M 击败 4B 的基准解读、三款型号的选型指南340M 英文版在英文任务上精度/成本最优、multi-Decide 是官方推荐的多语言方案、1B 面向可微调且有算力预算的场景、客服工单路由与邮件分诊落地清单、多标签与阈值调参、CPU/GPU 本地部署与长文档分块策略9 月底的一篇行业周报更把轻量决策GLiNER2.5-Decide与推理效率提升、运行时治理并列为 2026 年 9 月 AI 的主线之一。风口判断决策模型不是下一个 Agent而是 Agent 的决策器官回到标题的问题决策模型会是下一个 Agent 吗答案是——它不会取代 Agent但会成为 Agent 基础设施里最稀缺的那块拼图。支撑风口的三重证据其一接口形态已经收敛。Jev 的 choice/score/noul、GLiNER2.5-Decide 的 schema 驱动分类、复刻派的 logits 读取本质上都是封闭选项 概率输出。接口一旦收敛工具链MCP、hook、路由就会快速补齐——Jev 生态 20 个应用项目已经演示了这一点。其二成本曲线被重构。决策模型不生成 token输出免费一次前向毫秒级完成340M 参数可 CPU 部署。对比之下让 4B 模型为这句话是 refund_request 还是 shipping_delay写 200 个 token是纯粹的浪费。在 Agent 调用成本被逐轮审计的 2026 年这是实打实的财务逻辑。其三评测体系开始成型。fast-decisions 基准让不同技术路线第一次在同一文本、同一候选标签下同台竞技Jev 生态的复刻派也在各自搭建校准验证。有基准才有迭代有迭代才有生态。但也必须冷静复刻派的概率校准普遍未达标多篇源文明确提示生产前需自行分桶验证选项数量有硬上限OpenJev 的 choice 最多 128 个GLiNER2.5-Decide 自己也承认不是通用模型不推理、不解释、不回答开放问题README.md 的 Details 章节。它的边界恰好划在结构化运营决策意图、路由、紧急度、审核、完成度判定、转人工门槛——这些任务的特点是答案空间封闭、错误代价可度量、需要毫秒级反馈正是生成式大模型最不经济、而确定性规则又写不出来的中间地带。所以更准确的判断是2026 下半年爆发的不是决策模型应用的风口而是决策模型基础设施的风口。Agent 负责生成与执行决策模型负责在每一个需要分支的节点给出廉价、可校验的判断——Canny 的事实归代码判断归模型、jev-review 的模型打分、人改代码、Prism 的判断状态但不碰下单键以及 GLiNER2.5-Decide 在工单路由、邮件分诊、Agent 完成度判定上的全部设计指向同一个分工图景。开发者现在值得做的事与 Jev 生态总结里的建议一致先在自己的系统里接一个最小决策场景——把意图识别、路由或审核分级从提示词里拆出来交给一个能直接返回概率的分类器。模型会持续迭代但封闭选项 概率输出这个接口形态大概率是接下来两年 Agent 架构里最稳定的地基之一。【免费下载链接】GLiNER2.5-Decide项目地址: https://ai.gitcode.com/hf_mirrors/fastino/GLiNER2.5-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考