
WAIC 2026 刚散场书生S2-397B 就靠追平万亿参数刷屏了【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397BWAIC 2026 的聚光灯还落在周伯文主旨演讲里那句AI 科学元认知时刻上上海 AI Lab 的开源社区已经开始被一个新名字刷屏Intern-S2-397B——书生系列迄今最强的科学智能多模态基座模型一个 397B 参数的 MoE宣称在多项科学基准上追平万亿参数级的 Intern-S1-Pro。这个说法为什么能炸场它的评测口径是什么、边界在哪里、底层架构又藏着什么工程细节本文直接从模型仓库的 config、分词器与部署文档出发把这场以小博大的热度拆成可验证的技术事实。一、从科学元认知时刻到端砚平台S2-397B 在发布版图中的位置先交代现场背景。WAIC 2026 期间多家媒体央广财经、人民政协网、21财经、界面等集中报道了周伯文的主旨演讲他提出迎接 AI 的科学元认知时刻并发布了面向科学发现源头创新的书生·端砚平台定位是让普通人也能借助 AI 开展科学研究浦江实验室同期宣布发力打造 AI 时代的隐形基石。端砚平台回答的是谁在用、怎么用而 Intern-S2-397B 回答的是底层是谁在干活。仓库 README.md 的开篇给 S2-397B 的定位一句话面向科学智能scientific intelligence与长程 Agentlong-horizon agents的最强多模态基座模型。它沿三个维度做 scaling视觉原生预训练直接从科学文献的原始页面raw pages学习在共享表征空间里同时建模符号语义与视觉关系跳过中间解析环节保留图文对应关系强化空间与视觉推理科学任务强化学习覆盖 20 科学领域的多任务 RL 联合训练官方称其在开源模型中达到领先的通用推理表现并在生物分子互作设计、材料结构生成等专业任务上有强结果长程智能体 RL把多个 Agent 框架接入大规模沙盒环境做黑盒 agentic 强化学习抬高通用与科学域长程任务的能力上限。换句话说端砚是应用层的操作台S2-397B 是被开源出来、可以自托管的发动机。Apache-2.0 许可见 LICENSE意味着这条链路从模型权重到 API 形态全部开放这也是社区讨论度高的前提之一。二、拆 config397B MoE 的骨架长什么样营销话术之外config.json 才是理解这个模型最硬的证据。几个关键数字维度配置值含义architecturesQwen3_5MoeForConditionalGeneration基于 Qwen3.5 MoE 条件的多模态架构num_hidden_layers60文本主干共 60 层num_experts/num_experts_per_tok512 / 10每 token 只激活 512 个专家中的 10 个外加 1 个共享专家shared_expert_intermediate_size: 1024layer_typeslinear_attention× 3 full_attention× 1 循环每 4 层中仅 1 层全注意力full_attention_interval: 4其余为线性注意力——长上下文的成本被结构性压低mtp_num_hidden_layers1内置一层 Multi-Token Prediction为推测解码打底max_position_embeddings262144原生 256K 上下文vocab_size251392基础词表 科学模态扩展区vision_config.depth2727 层视觉编码器patch_size: 16temporal_patch_size: 2三个值得展开的工程点1. 混合注意力Gated/Linear Full是256K 上下文不烧钱的关键。layer_types里 45 层线性注意力、15 层全注意力线性侧用linear_conv_kernel_dim: 4、linear_num_value_heads: 64等参数实现类 Mamba 的低成本状态传递mamba_ssm_dtype: float32。这就是为什么官方敢把评测口径推到文本推理 256K 最大推理长度README 中明确文本推理基准最大推理长度 256K tokens多模态基准 64K tokens。2. MTP 不是外挂技巧而是训练时就在主干里的。mtp_num_hidden_layers: 1表明多 token 预测头是一等公民。部署侧三个框架都给出了 MTP 推测解码配方deployment_guide.mdLMDeploy 用--speculative-algorithm qwen3_5_mtp --speculative-num-draft-tokens 4vLLM 用--speculative-config {method:mtp,num_speculative_tokens:3}SGLang 则走--speculative-algo NEXTN配合 4 个 draft token。社区此前对 S2-Preview 系列 8×H200 环境的实测MTP 在 16K 输出长度下吞吐接近翻倍、TPOT 大幅下降说明这条加速链路是真实可用的。3. 视觉塔与 397B 的关系。vision_config中 27 层 ViT 把 16×16 patch2×2 时空合并映射到 4096 维主干。视觉塔参数量相对 397B 主干很小多模态在这里主要吃的是主干的 MoE 容量——这与视觉原生预训练直接从文献页面学的范式自洽页面级图文混合输入靠的是文本侧的建模能力兜底。再看 README.md 推荐的采样参数top_p0.95, top_k50, min_p0.0, temperature0.8与 generation_config.json 的出厂默认temperature0.6, top_k20不一致——官方明确建议以 README 参数为准这也是部署时一个容易踩的坑。三、科学模态不是营销词分词器里实打实的 SMILES / PROT / XNA科学大模型最容易沦为贴标签。但这个仓库里科学模态是长在 tokenizer 里的。tokenizer_config.json 声明了三个独立的 SentencePiece 子分词器及其词表偏移offset_SMILES: 248102, offset_PROT: 249126, offset_XNA: 250150对应仓库根目录下的 tokenizer_SMILES.model、tokenizer_PROT.model、tokenizer_XNA.model 三个 SPM 模型由自定义 tokenizertokenization_interns1.py中的InternS1Tokenizertokenizer_class在prepare_extra_tokenizers里加载SMILES分子从 248102 起、蛋白序列从 249126 起、DNA/XNA 从 250150 起各自占据词表的高位区间。词表里还能看到成对的任务定界符SMILES//SMILES、protein//protein、dna//dna、rna//rna。更进一步tokenization_interns1.py 实现了三个自动检测模块SmilesCheckModule正则 括号/环号合法性校验fast/slow 双通道自动把裸文本里的合法 SMILES 串包进SMILES_AUTO_DETECTProtCheckModule蛋白序列自动识别最小长度 27XnaCheckModuleXNA 序列自动识别。也就是说用户不需要手动加定界符分词器会把输入中合法的科学序列识别—校验—切进专属子词表。这对分子坐标回归、晶体结构生成这类任务的意义是原子与键的表示在 token 级就是紧凑且无歧义的而不是被通用 BPE 切碎成噪声。同样长在这套机制里的还有时间序列模态。chat_template.jinja 中显式处理了time_series类型的 content 项渲染为|ts|TS_CONTEXT|/ts|占位结构词表中对应|ts|、TS_CONTEXT、TS_GEN等专用 token并且当消息含时序数据或显式关闭思考模式时模板会注入空的think\n\n/think直接跳过推理。README 给出的地震 P/S 波检波与电力负荷预测示例中预测请求通过extra_body传enable_forecasting: True和forecast_horizon响应体里多出ts_forecast.point_forecast/quantile_forecast字段——时序预测已经是一种结构化的输出协议而不是让模型口算数字。需要注意的边界README 明确写了Time series inference is currently only supported in LMDeploy。时序能力的部署路径目前是单框架独占这一点在选型时要算进去。四、追平万亿参数的说法从哪来评测口径与适用边界先把传播链条理清楚。397B 追平万亿这个叙事不是凭空冒出来的它建立在一条完整的证据线上前身铺垫社区CSDN 多篇2026 年 1 月至 6 月早已围绕 35B 的 Intern-S2-Preview 反复讨论35B 参数如何超越万亿级模型——对标物正是万亿参数级的 Intern-S1-Pro论据包括 MolecularIQ 57.26 分媒体称超过 Gemini-3.1-Pro、晶体结构生成通过率超 40% 等。397B 是这条小模型追平万亿路线上的放大版话题延续性天然存在媒体引爆WAIC 2026 期间网易科技等以《397B 参数追平万亿模型上海 AI Lab 发布科学智能体新基座》为题跟进报道追平二字被直接做进标题成为传播钩子仓库自证README.md 的 Performance 一节给出了对比图上文配图并注明评测协议——使用 OpenCompass、VLMEvalKit、AgentCompass 三个框架跑全部模型文本推理基准最大推理长度 256K tokens多模态基准 64K tokens图例约定下划线为开源模型最佳、加粗为全模型最佳。把口径拆开追平至少有三条适用边界读者引用前应当明确对标对象是科学基准而非通用榜单。万亿指的是 Intern-S1-Pro 这一档科学旗舰。开源阵营里最佳下划线与全模型最佳加粗是两档结论README 只说 S2-397B 在科学任务上强、通用推理在开源中领先并不等于在所有闭源旗舰前面全面胜出长推理预算是成绩的一部分。256K 的最大推理长度意味着思考型任务可以消耗大量 token 换正确率。对延迟敏感的服务化场景同等硬件下的单请求成本会显著高于 32K/64K 口径的对比对比图细节以仓库图片为准。本仓库中figs/intern-s2-397b.jpg由 Git LFS 托管逐项分数请以上文配图的渲染版本为准本文不做逐格转述避免二手失真。部署侧的边界同样具体deployment_guide.md 的官方推荐配置是H100×8 或 H200×8节点FP8 权重internlm/Intern-S2-FP8配 LMDeploy--dp 4 --ep 8、vLLM/SGLang--tensor-parallel-size 8若要把上下文从 256K 拉到 512K需要显式叠加 YaRN RoPE 覆盖--hf-overrides里rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144vLLM 侧还要VLLM_ALLOW_LONG_MAX_MODEL_LEN1。追平万亿的前提是你得起动一个八卡节点。五、对国产科学大模型叙事意味着什么这波刷屏真正的信息量不在又一个大模型发布而在三件事第一参数效率叙事从口号变成了可复现的架构事实。512 专家 top-10 激活的 MoE 3:1 线性/全注意力混合 训练期内置 MTP这组配置解释了为什么 397B 敢对标万亿激活参数远小于总参数长上下文的边际成本被注意力结构压低解码吞吐被 MTP 拉回。社区对 S2 系列的实测MTP 长输出下吞吐接近翻倍与部署文档中的默认 MTP 配方互相印证。国产科学模型第一次不用堆到万亿来兑现旗舰表现这对算力受限的团队是实质性利好。第二科学能力下沉到 tokenizer 与协议层而不是 prompt 层。SMILES/PROT/XNA 三路子词表加自动检测、时序数据的结构化输入输出协议ts_forecast分位数预测、思考/非思考模式在 chat_template.jinja 里的一等公民地位enable_thinkingFalse时模板自动折叠思考块——这些意味着科学任务被当作训练目标 表示问题解决而不是给个提示词看看。对比 S1-Pro 时代需要外部工具链拼装分子表示的做法工程上的护城河加深了一层。第三Agent 化与本地化部署构成了科学数据的现实出口。README 的 Agent Integration 一节给出了两条完整路径自托管LMDeploy 的 OpenAI 兼容端点http://0.0.0.0:23333/v1并提示用--tool-call-parser interns2-preview解析工具调用与官方 APIOpenAI 兼容 Anthropic 兼容双网关可直接接 Claude Code。工具调用格式在 chat_template 里是 XML 风格的 【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考