
UltraX预训练实验结果完整解读1B模型、10大基准、34/50项SOTA【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview这篇文章带你完整解读UltraX官方预训练实验结果OpenBMB 推出的大规模预训练数据精炼框架在 5 个英文语料上用1B 参数模型从零预训练 20B tokens在10 大基准上全部拿下最高平均分50 项任务-语料组合中赢得34 项 SOTA 实验设置1B 模型是怎么考出来的先看实验条件这是读懂全部数字的前提项目设置模型1B 参数 MiniCPM从零预训练不是微调训练量每个语料20B tokens语料5 个经 UltraX 精炼的英文语料每个约 20B tokens评测LightEval 零样本zero-shot设定对比基线Raw原始语料与 ProX-C文档级精炼基线也就是说这不是给好模型喂好数据的加分操作而是同等条件下比数据质量同样的 1B 模型、同样的训练 token 数只换训练语料看谁的成绩更好。这种控制变量设计正是结论可信的关键 ✅ 10 大基准每个在考什么评测覆盖 10 个主流常识与知识基准兼顾知识广度和推理深度基准考察内容ARC-C小学三年级科学推理挑战版ARC-E小学五年级科学推理简易版CSQA大学水平常识科学问答HellaSwag日常情境常识推理MMLU57 个学科的多任务知识大考OBQA物理常识问答PIQA物理交互常识SIQA社交意图常识推理WinoGrande代词消解与语言常识SciQ小学科学四选一5 个语料 × 10 个基准 50 个任务-语料组合这就是34/50的分母来源。 核心结论一34/50 项 SOTA 意味着什么UltraX 精炼语料在全部 5 个语料上的平均性能都是第一名并在 50 项组合中赢得34 项最佳68% 胜率。对新手来说平均第一比单项第一更重要它说明 UltraX 的精炼是全面提纯而不是在个别简单基准上刷分。5 个语料来源差异很大Common Crawl 网页、多源网页、HTML 高保真解析、质量过滤版、文档级精炼版全部夺冠说明方法具有泛化性而非只对某一类数据有效 核心结论二平均相对提升 2.00% 与 1.53%论文的关键数字相比Raw未精炼原始语料UltraX 平均相对提升约 2.00%相比ProX-C已相当强的文档级精炼基线UltraX 平均相对提升约 1.53%在预训练领域2% 的平均相对提升是重量级成果——通常这意味着同等算力下模型变聪明了或同等效果下训练成本更低。更值得注意的是 UltraX 还要和 ProX-C 比它赢过的不是一个弱基线而是业界公认优秀的精炼方法。⚡ 核心结论三数据效率——16B tokens 追平并反超 20B 基线这可能是最有说服力的一个发现在 FineWeb 语料上UltraX 仅训练16B tokens平均 45.49 分就已超过 Raw45.08 分和 ProX-C45.05 分训练满20B tokens的最终成绩。翻译成人话少喂 20% 的数据成绩反而更高—— UltraX 的每个 token 都更值钱对工程团队意味着真金白银的算力节省更早达到目标性能更短的训练周期说明精炼带来的不是噪声减少这么简单的效果而是有效信息密度的提升。数据质量优化的价值在这条曲线上体现得淋漓尽致 ⚡️ 数据在哪里5 大语料文件速查本仓库直接包含 5 个精炼语料的全部分片文件共 479 个 parquet 分片数据集源语料分片数数据目录UltraX-FineWebFineWebCommon Crawl 网页104data/UltraX-FineWeb/UltraX-RedPajama-V2RedPajama-v2多源网页110data/UltraX-RedPajama-V2/UltraX-AICCAICCHTML 高保真网页61data/UltraX-AICC/UltraX-Ultra-FineWebUltra-FineWeb质量过滤104data/UltraX-Ultra-FineWeb/UltraX-FineWeb-ProX-DocFineWeb-ProX-Doc文档级精炼100data/UltraX-FineWeb-ProX-Doc/每个 parquet 文件固定 5 列方便你做前后对比列名含义uid唯一标识raw_content 的 MD5 哈希raw_content精炼前的原始文本cleaned_contentUltraX 精炼后的文本processed_functions实际执行的编辑操作记录source源语料名称raw_content与cleaned_content并排存放是个贴心设计——你可以直接对比同一条样本的编辑前后差异理解精炼到底改了什么。示例文件可参考 data/UltraX-FineWeb/UltraX-FineWeb-en-part-0001-of-0104.parquet 为什么 UltraX 能赢方法速览看完结果用一分钟理解它背后的核心设计详见 README.md函数调用式精炼而非端到端改写传统方法要么靠人工规则要么让大模型整篇重写。UltraX 训练一个轻量精炼模型预测 5 种结构化编辑操作——keep_all无需修改、remove_all整篇无价值如错误页/登录墙、remove_lines删行、replace_str行内替换、add_line插入新行再在原文上确定性执行可控且可审计LAM DCR 流水线行级对齐映射LAM把原文与精炼文本逐行对齐动态上下文替换DCR把字符级编辑转成带唯一上下文锚定的可靠替换操作为大规模而生滑动窗口推理、重叠感知聚合、歧义过滤、同行操作合并、重复模式检测保障数亿级文档的可靠执行。一句话总结不是重写内容而是精准手术——这正是它能同时保证质量与效率的原因 快速上手3 步开始使用第 1 步按配置名加载对应语料5 个配置与数据集一一对应UltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc第 2 步训练时直接使用cleaned_content列作为输入文本raw_content留作对照与复现第 3 步若资源有限可优先从 FineWeb 语料入手——它的 16B tokens 反超实验就是数据效率的最佳例证。 新手常见疑问Q为什么不直接看单项分数要看平均分A单项可能有波动平均分反映整体能力水位。而 UltraX 是平均分全第一 单项 34/50 第一两个口径同时成立结论才站得住。Q20B tokens 对 1B 模型够吗A这是学界常见的小模型大语料验证设置——参数小、训练快但足以暴露数据质量差异是性价比极高的对比实验方案。QUltraX 适合我用吗A如果你的预训练语料来自网页抓取Common Crawl 类UltraX 的逐例精炼思路与这套现成精炼语料都值得直接借鉴或试用如果是代码/数学等垂域语料可参考其函数调用式精炼思路自建精炼管线。 结语回到文章开头的那组数字1B 模型、10 大基准、34/50 项 SOTA、2% 平均相对提升、16B tokens 反超 20B 基线——它们共同指向一个结论在预训练时代数据精炼就是免费的算力。UltraX 用函数调用式编辑把这种免费算力做成了可复现的工程方法而这 5 套精炼语料就放在仓库里随时可以验证。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考