
RCO如何在尺寸预算下精准分配精度Qwen3.8-Flash-Next-GSQ-RCO-GGUF黎曼优化搜索原理【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF这个项目为 512 专家 MoE 模型Qwen3.8-Flash-Next提供了一套非均匀 GGUF 量化权重核心亮点是RCO黎曼约束优化它不把量化精度一刀切而是在总尺寸预算内为每一个权重张量精准分配最合适的量化类型。最终产出的文件就是标准 GGUF可直接在 llama.cpp、Ollama、LM Studio 中运行。为什么统一量化不够一张尺寸预算表普通量化如全部用 Q4_K把同一种量化类型套在所有张量上。但不同张量对精度的敏感度差异很大有的张量 2 bit 就够有的必须 6 bit 才不崩。Qwen3.8-Flash-Next 是稀疏 MoE48 层、每层 512 个路由专家但每个 token 只激活 10 个。路由专家矩阵占了参数量的绝对大头——95% 的可搜索权重都在专家里因此 RCO 的自由主要花在专家层上按层而非按单个专家分配这是 GGUF 格式能表达的最细粒度。仓库提供了 4 个不同的尺寸预算档位每档都是一次独立的 RCO 搜索目录平均位宽 (bpw)总大小定位Q2_0/2.4066.4 GB追求速度避开查表格式IQ2_XS/2.5068.0 GB同等质量下最小IQ3_XXS/3.0075.8 GBAIME25 追平原模型IQ3_S/3.5083.6 GB推荐档各任务追平/超越 BF16完整说明见 README.md。RCO 搜索原理三步流水线整个量化过程由两个方法协作完成均为奥地利科学技术研究院 DASLab 出品GSQ 建立张量数据库——对每个权重张量用 GSQGumbel-Softmax 标量量化在所有候选 GGUF 量化类型下各产出一个变体。GSQ 通过 Gumbel-Softmax 松弛联合学习每个坐标的网格分配与分组缩放在 2–3 bit 区间把标量量化与向量量化的差距缩小到可忽略。RCO 在预算约束下做梯度搜索——这是核心创新。RCO 要解决的问题是给 N 个张量各分配 K 种量化类型之一使整文件平均位宽恰好等于目标值同时任务损失最小。传统做法把预算当惩罚项加进损失需要调惩罚系数RCO 则把预算约束改写成 logit 空间中的一个光滑黎曼流形梯度优化直接在任务损失上进行、在流形内部运动预算被精确满足无需任何针对约束的超参数。拼装——把搜索选中的每张量变体拼进一个标准 GGUF 文件。本模型一次搜索覆盖352 个张量304 个稠密张量注意力、SSM 投影、共享专家、嵌入、输出头 48 个按层融合的路由专家矩阵。一个有趣的细节ffn_down_exps每层只有 640 行无法被 256 整除所有 block-256 的 K/I 系列格式都被排除只能走 Q2_0block 64和 IQ4_NLblock 32这条短量化阶梯。真实分配结果每个张量都有自己的类型每个发布的 GGUF 都随附一份可审计的分配清单例如 tensor-allocation/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.rco-allocation.txt。目标 3.00 bpw 档的类型直方图里同时出现了 IQ2_XXS、IQ2_S、IQ3_S、IQ4_NL、Q6_K 等十余种类型——这正是非均匀的直观体现。对比两个档位下同一批张量的分配能清楚看到 RCO 如何把多出来的预算花在刀刃上张量Q2_0 档 (2.40 bpw)IQ3_S 档 (3.50 bpw)blk.0.attn_qkv.weightIQ4_XSQ6_Kblk.24.ffn_gate_exps.weightQ2_0IQ2_Sblk.47.ffn_gate_exps.weightQ2_0IQ4_XSblk.0.ffn_down_exps.weightQ2_0IQ4_NL注意第 24 层和第 47 层在同一个档位里分配到了不同的类型IQ2_S vs IQ4_XS——这就是按层敏感度动态分配的直接证据。ffn_down_exps在 IQ3_XXS 档有 18/48 层被提升为 IQ4_NL其余保持 Q2_0同样遵循此逻辑。预算换来的效果按平均位宽排列四个档位任务平均分AIME25、GPQA-Diamond、LiveCodeBench v6 三项均值的变化非常平滑2.40 bpwQ2_089.07约为 BF1693.12的 95.7%3.00 bpwIQ3_XXS92.57达基线 99.4%体积缩小 4.7 倍3.50 bpwIQ3_S93.26全面追平甚至略超 BF16而体积不足其 1/4这说明 RCO 的预算分配确实花在刀刃上多出来的每 0.1 bit 都转化成了可测量的质量收益而不是浪费在不敏感的张量上。本地运行与内存规划两个分片都要下载llama.cpp 拿到第一个会自动加载第二个llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf \ -lm mmap --lazy-mode on -ngl 99只需让分片 1变换器权重驻留显存分片 2 是 51.2B 参数的 n-gram 查表固定 IQ4_NL不参与搜索按 token 稀疏读取-lm mmap --lazy-mode on让它留在 SSD 上内存映射即可。多模态用户另加 mmproj-Qwen3.8-Flash-Next-BF16.gguf视觉编码器投影器0.91 GB即可。可复现性审计文件想验证每个张量到底被分到了什么类型直接看对应清单tensor-allocation/Qwen3.8-Flash-Next-GSQ-RCO-Q2_0-00001-of-00002.rco-allocation.txttensor-allocation/Qwen3.8-Flash-Next-GSQ-RCO-IQ2_XS-00001-of-00002.rco-allocation.txttensor-allocation/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.rco-allocation.txttensor-allocation/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_S-00001-of-00002.rco-allocation.txt一句话总结GSQ 负责每个张量怎么量化最准RCO 负责在固定字节数下每个张量该用哪种精度——前者是量化器后者是把尺寸预算变成可微分约束的黎曼优化器。两者结合就得到了在任意目标位宽下都能近乎线性恢复质量的非均匀 GGUF。【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考