Xing4.0-29B-A4B 模型全解析:29B 总参数 4B 激活的 MoE 架构、长上下文部署与 Agent 场景实战指南 【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型。模型总参数量 29B激活参数仅 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B点击查看免费下载Xing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列新一代模型总参数量 29B、每 token 仅激活 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力Ascend NPU与国产框架MindSpore完成训练、面向复杂工程任务深度优化的百亿参数大模型。本文以仓库内的 README 文档为骨架结合 configuration_xing4_0.py、modeling_xing4_0.py、config.json、generation_config.json、chat_template.jinja、tokenizer_config.json 等源码与配置文件完整讲解模型架构mHC MLA MoE MTP、关键超参数、OpenAI 兼容 API 推理调用、推荐采样参数、主流推理框架vLLM / SGLang / KTransformers服务部署、Agent 工具调用模板、微调适配与领域定制路径。读者读完后将能独立完成该模型从权重加载、单次推理、采样参数调优到生产化服务部署与下游任务微调的全流程操作并理解每个配置项背后的源码实现含义。模型总览Xing4.0-29B-A4B 是 Xing 系列前身 TeleChat的新一代模型官方在 README 中给出的核心规格如下项目数值总参数量29B每 token 激活参数量4B层数Number of Layers40隐藏维度Hidden Size3584Dense FFN 中间维度9216Expert 中间维度1024注意力类型MLAMulti-head Latent Attention路由专家数Routed Experts64每 token 激活专家数4共享专家数Shared Experts1上下文长度256K可扩展至 512K这些规格在仓库的 config.json 中均有对应字段num_hidden_layers40、hidden_size3584、intermediate_size9216、moe_intermediate_size1024、n_routed_experts64、num_experts_per_tok4、n_shared_experts1、max_position_embeddings262144即 256K。仓库以 Hugging Face Transformers 格式提供模型权重与配置文件兼容 Transformers、vLLM、SGLang、KTransformers 等主流推理框架。权重分布在 41 个分片文件model-00001-of-00041.safetensors 至 model-00041-of-00041.safetensors中由 model.safetensors.index.json 维护权重分片映射其metadata.total_size约为 62.4 GB。核心架构mHC MLA MoE MTPREADME 的 Highlights 明确指出该模型基于mHCMulti-head Hyper-Connection MLA MTP架构。从 modeling_xing4_0.py 的源码可以完整印证这一结构Xing4_0HyperConnectionmHC见 modeling_xing4_0.py#L451-L483。每个 DecoderLayer 都带有一个attn_hc与一个ffn_hc超连接模块对隐藏状态执行 Sigmoid 门控、双路加权与 Sinkhorn 迭代归一化的多头组合相关超参数hc_mult4、hc_sinkhorn_iters20、hc_eps1e-6、mhc_h_res_clamp_min/max-30/30均定义在 config.json 中。这是模型面向长上下文推理稳定性的关键设计。MLAMulti-head Latent Attention见 modeling_xing4_0.py#L333-L448。通过q_a_proj/q_a_layernorm/q_b_proj压缩 Query通过kv_a_proj_with_mqa/kv_a_layernorm/kv_b_proj压缩 KV低秩潜变量显著降低长上下文下的 KV Cache 内存占用。配置字段q_lora_rank768、kv_lora_rank512、qk_nope_head_dim128、qk_rope_head_dim64、v_head_dim128定义了各压缩维度。MoE混合专家见 modeling_xing4_0.py#L139-L211。Xing4_0TopkRouter采用 Sigmoid 打分scoring_funcsigmoid、无辅助损失的noaux_tc路由方式每个 token 路由到 4 个专家num_experts_per_tok4并对 top-k 概率做归一化与缩放routed_scaling_factor2.0Xing4_0MoE同时包含 1 个始终参与计算的共享专家shared_experts。前 2 层first_k_dense_replace2为 Dense 层其余层均为 MoE 层moe_layer_freq1。MTPMulti-Token Prediction配置num_nextn_predict_layers1别名num_mtp_layers见 configuration_xing4_0.py#L35-L38 的attribute_map通过预测多个未来 token 提升训练效率与推理吞吐。从实现细节看Xing4_0Model在前向时会把输入嵌入扩展为hc_mult条隐藏流modeling_xing4_0.py#L621逐层经过 40 个 DecoderLayer 后取均值并做最终 RMSNormmodeling_xing4_0.py#L633-L634。模型采用 bfloat16 精度dtype: bfloat16词表大小 131072启用 Flash Attention、SDPA 与 Flex Attention 支持modeling_xing4_0.py#L544-L546。长上下文支持与 RoPE 扩展README 声明模型原生支持 256K 上下文、可扩展至 512K。仓库配置对此做了完整的实现支撑config.json 中max_position_embeddings262144同时配置了 YaRN 方式的 RoPE 扩展rope_scaling: { beta_fast: 32, beta_slow: 1, factor: 64, mscale: 1.0, mscale_all_dim: 1.0, original_max_position_embeddings: 4096, type: yarn }这意味着模型在 4096 的原始训练长度基础上通过 YaRNtype: yarn缩放因子factor: 64将有效上下文扩展到 256K。源码中Xing4_0RotaryEmbeddingmodeling_xing4_0.py#L60-L120根据rope_type分发到 Transformers 的ROPE_INIT_FUNCTIONS并实现了 interleave 式的旋转位置编码rope_interleaveTrue见 modeling_xing4_0.py#L286-L324通过直接对奇偶切片旋转避免额外的内存拷贝。在长上下文评测中如 SWE-bench Verified 使用 210K 上下文窗口、Claw-Eval 与 DeepresearchBII 使用 256K 窗口这一扩展能力得到充分验证。快速开始OpenAI 兼容 API 推理README 的 Quickstart 部分给出了通过 OpenAI 兼容 API 调用模型的完整示例。模型名称为Xing4.0-29B-A4B示例代码如下base_url与api_key需替换为你实际的服务地址与密钥from openai import OpenAI client OpenAI( base_urlyour-base-url, api_keyyour-api-key, ) completion client.chat.completions.create( modelXing4.0-29B-A4B, messages[{role: user, content: Briefly explain the basic principles of quantum computing.}], temperature1.0, top_p0.95, extra_body{ repetition_penalty: 1.05, skip_special_tokens: False, spaces_between_special_tokens: False, chat_template_kwargs: { enable_thinking: True, # Set to False to disable thinking }, }, ) print(completion.choices[0].message.content)几个关键参数需要结合仓库配置理解temperature1.0、top_p0.95与 generation_config.json 中的默认值完全一致do_sample: true, temperature: 1.0, top_p: 0.95, repetition_penalty: 1.05。repetition_penalty1.05用于抑制长文本生成中的重复。chat_template_kwargs.enable_thinkingTrue控制是否启用模型的思维链thinking模式。这一点在 chat_template.jinja 中体现当enable_thinking未定义或为真时助手消息会以think\n{reasoning}\n/think包裹推理过程当设为False时只输出/think直接进入正式回复chat_template.jinja#L70-L76。模型在思考后正常回答时默认不会在正式回复中再次打印/think需要按模板逻辑处理。skip_special_tokensFalse与spaces_between_special_tokensFalse配合使用保证工具调用等特殊 token 在输出中完整保留、不被空格拆散。该对话模板支持 system / user / assistant含reasoning_content字段与think块解析/ tool 等多角色消息并原生支持tools/tools工具签名注入与tool_call/tool_response的工具调用与观测回传格式是 Agent 场景的基础协议详见下文 Agent 与工具调用章节。服务部署vLLM、SGLang 与 KTransformersREADME 明确说明该模型支持通过vLLM、SGLang、KTransformers三大推理框架进行部署详细启动参数见官方 GitHub 仓库。部署要点如下vLLM启动 OpenAI 兼容服务时模型名使用Xing4.0-29B-A4B并确保服务端加载了仓库内的 chat_template.jinja 对话模板以支持 thinking 开关与工具调用格式。SGLang同样以仓库权重目录加载模型利用其对长上下文与 MLA 的优化支持 256K 上下文推理。KTransformers适用于需要低成本部署例如利用 CPU 与 GPU 异构计算加载大权重的场景。启动任一框架后即可使用上文 OpenAI 兼容 API 代码进行访问。需要说明的是本仓库以只读形式提供权重与配置文章只介绍查看、安装、运行与配置方式具体启动命令行参数以各框架文档与官方仓库发布为准本仓库内未包含各框架的启动脚本。推荐采样参数README 给出了两个典型场景的推荐采样参数建议直接套用场景temperaturetop_prepetition_penalty复杂推理 / 通用任务1.00.951.05编程 / Agent 任务0.80.951.05参数含义与适用范围temperature温度控制输出随机性。复杂推理/通用任务使用1.0保留多样性编程与 Agent 任务使用0.8使输出更确定、更聚焦于代码与工具调用降低不稳定输出风险。top_p核采样0.95在保留 95% 概率质量的同时截断长尾低概率 token。repetition_penalty重复惩罚1.05轻微抑制重复适合长文本、长代码与长链路推理。这些参数与 generation_config.json 的默认值一致可直接作为服务端默认采样配置也可在每次请求中通过extra_body覆盖。Agent 与工具调用从架构到模板README 将Agent-Oriented Architecture面向 Agent 的架构列为首要亮点基于 mHC MLA MTP 架构支持多步规划、工具调用与复杂推理链执行确保长上下文下的任务连贯性与执行稳定性。工具调用协议chat_template.jinja 完整实现了 Agent 工具调用所需的模板协议工具注册当tools列表非空时模板在 system 消息后注入# Tools说明与tools.../toolsXML 标签其中每个工具以 JSONtojson(ensure_asciiFalse)形式序列化其函数签名chat_template.jinja#L30-L45。工具调用输出格式模型被引导以tool_call{function-name}param_key{key}/param_keyparam_value{value}/param_value.../tool_call的 XML 格式输出函数名与参数chat_template.jinja#L43-L44。工具结果回传role tool的消息被包装为tool_response.../tool_responsechat_template.jinja#L88-L103形成“思考 → 调用 → 观测 → 再思考”的完整 Agent 循环。特殊 token 对齐tokenizer_config.json 中注册了think、/think、tool_call、/tool_call、tool_response、/tool_response等特殊 token确保模板生成的标记在分词时保持一致。生态兼容README 说明该模型已针对OpenCode、Claude Code、OpenClaw、Hermes等 Agent 框架完成适配与格式对齐可无缝集成进现有工作流评测环节也使用了 OpenCode harnessDeepresearchBII与 Claw-Eval 官方 harness。这意味着开发者可直接将这些框架指向本模型的 OpenAI 兼容端点获得一致的 thinking 与工具调用行为。微调与领域定制README 指出模型完整兼容LLaMA-Factory与MindFormers进行微调且非常适合下游任务微调通用微调框架使用 LLaMA-Factory 或 MindFormers 加载本仓库的 Transformers 格式权重即可进行全参或 LoRA 等轻量微调。领域适配场景官方明确列举了意图分类intent classification、表格理解table understanding、合同审计contract auditing、基于知识的问答knowledge-based QA等垂直领域可在专有数据上进行低成本定制快速构建领域能力并上线。MindFormers 原生对齐模型本身由 MindSpore/MindFormers 训练并针对 Ascend 910C 集群做了 mHC 特性适配与融合算子开发因此 MindFormers 微调链路与训练侧完全同源。路由机制支持轻量定制从源码看configuration_xing4_0.py#L40-L140 提供Xing4_0Config的完整可配置参数如n_routed_experts、num_experts_per_tok、moe_intermediate_size等微调时可通过修改config.json对应字段保持结构一致仅更新权重。微调完成后导出的模型仍可沿用本文的 OpenAI 兼容 API 与服务部署流程上线。关键配置文件字段速查为便于实践下表汇总了 config.json 中核心字段及其在 configuration_xing4_0.py 中的对应含义字段值说明architecturesXing4_0ForCausalLM模型入口架构model_typexing4_0注册的模型类型hidden_size3584隐藏维度intermediate_size9216Dense FFN 中间维度moe_intermediate_size1024单个专家 FFN 中间维度num_hidden_layers40解码器层数num_attention_heads32注意力头数n_routed_experts/num_experts_per_tok64 / 4路由专家总数 / 每 token 激活专家数n_shared_experts1共享专家数scoring_func/topk_methodsigmoid/noaux_tc路由打分函数与无辅助损失路由方法routed_scaling_factor2.0路由概率缩放因子norm_topk_probtrue对 top-k 概率归一化first_k_dense_replace2前 2 层为 Dense 层moe_layer_freq1每层均为 MoE 层前 2 层除外q_lora_rank/kv_lora_rank768 / 512MLA 的 Q/KV 低秩压缩维度qk_nope_head_dim/qk_rope_head_dim/v_head_dim128 / 64 / 128MLA 各子维度hc_mult/hc_sinkhorn_iters/hc_eps4 / 20 / 1e-6mHC 超连接参数num_nextn_predict_layers1MTP 层数别名num_mtp_layersmax_position_embeddings262144最大上下文256Krope_scalingyarn, factor64YaRN 长上下文扩展vocab_size131072词表大小dtypebfloat16权重精度bos_token_id/eos_token_id1 / 2起始/结束 token基准评测速览README 提供了模型在多项工程任务与 Agent 基准上的评测结果与 Gemma4-26B-A4B、Qwen3.6-35B-A3B 并列对比并附有各基准的评测设置Footnotes此处完整保留BenchmarkXing4.0-29B-A4BGemma4-26B-A4BQwen3.6-35B-A3BIFBench69.6772.6765.50AIME202690.0088.3092.70AA.LCR61.0066.0062.00Tau3-Bench64.6358.9067.20Claw-Eval76.5571.4974.54SWE-bench Verified75.0053.0076.00Terminal-Bench 2.157.5030.0051.50SWE-bench Multilingual66.0051.0067.20DeepresearchBII60.8039.3059.70评测设置摘要完整细节见 README 的 FootnotesSWE-bench Verified / SWE-bench Multilingual使用SWE-agentharnesstemperature1.0, top_p0.95, repetition_penalty1.05210K 上下文窗口。Terminal-Bench 2.1在terminus-2中评测temperature0.8, top_p0.95, repetition_penalty1.05, max_tokens64K24 小时超时取 3 次运行平均。Claw-Eval官方 harnesstemperature0.8, top_p0.95, repetition_penalty1.05, max_tokens16384256K 上下文窗口取 3 次平均。Tau3-Bench官方 harnesstemperature0.8, top_p0.95, repetition_penalty1.05, max_tokens16384取 4 次 pass^1 平均。DeepresearchBIIOpenCode harnesstemperature0.8, top_p0.95, repetition_penalty1.05, max_tokens32768256K 上下文窗口启用 Exa MCP server。AIME2026temperature1.0, top_p0.95, repetition_penalty1.05, max_tokens131072取 5 次平均。IFBenchtemperature0.8, top_p0.95, repetition_penalty1.05, max_tokens81920。AA.LCRtemperature1.0, top_p0.95, repetition_penalty1.05, max_tokens65536取 3 次平均。以上评测结果均来自官方 README 发布数据具体复现请遵循对应 harness 与参数设置。引用如需引用本模型及其系列工作可使用仓库 README 提供的 BibTeXmisc{liu2025trainingreporttelechat3moe, title{Training Report of TeleChat3-MoE}, author{Xinzhang Liu and Chao Wang and Zhihao Yang and Zhuo Jiang and Xuncheng Zhao and Haoran Wang and Lei Li and Dongdong He and Luobin Liu and Kaizhe Yuan and Han Gao and Zihan Wang and Yitong Yao and Sishi Xiong and Wenmin Deng and Haowei He and Kaidong Yu and Yu Zhao and Ruiyu Fang and Yuhao Jiang and Yingyan Li and Xiaohui Hu and Xi Yu and Jingqi Li and Yanwei Liu and Qingli Li and Xinyu Shi and Junhao Niu and Chengnuo Huang and Yao Xiao and Ruiwen Wang and Fengkai Li and Luwen Pu and Kaipeng Jia and Fubei Yao and Yuyao Huang and Xuewei He and Zhuoru Jiang and Ruiting Song and Rui Xue and Qiyi Xie and Jie Zhang and Zilu Huang and Zhaoxi Zhang and Zhilong Lu and Yanhan Zhang and Yin Zhang and Yanlei Xue and Zhu Yuan and Teng Su and Xin Jiang and Shuangyong Song and Yongxiang Li and Xuelong Li}, year{2025}, eprint{2512.24157}, archivePrefix{arXiv}, primaryClass{cs.CL}, url{https://arxiv.org/abs/2512.24157}, } misc{wang2025technicalreporttelechat2telechat25, title{Technical Report of TeleChat2, TeleChat2.5 and T1}, author{Zihan Wang and Xinzhang Liu and Yitong Yao and Chao Wang and Yu Zhao and Zhihao Yang and Wenmin Deng and Kaipeng Jia and Jiaxin Peng and Yuyao Huang and Sishi Xiong and Zhuo Jiang and Kaidong Yu and Xiaohui Hu and Fubei Yao and Ruiyu Fang and Zhuoru Jiang and Ruiting Song and Qiyi Xie and Rui Xue and Xuewei He and Yanlei Xue and Zhu Yuan and Zhaoxi Zhang and Zilu Huang and Shiquan Wang and Xin Wang and Hanming Wu and Mingyuan Wang and Xufeng Zhan and Yuhan Sun and Zhaohu Xing and Yuhao Jiang and Bingkai Yang and Shuangyong Song and Yongxiang Li and Zhongjiang He and Xuelong Li}, year{2025}, eprint{2507.18013}, archivePrefix{arXiv}, primaryClass{cs.CL}, url{https://arxiv.org/abs/2507.18013}, }总结Xing4.0-29B-A4B 以“29B 总参数、4B 激活”的 MoE 形态结合 mHC 超连接、MLA 潜变量注意力、YaRN 长上下文扩展与 MTP 多 token 预测构建了面向 Agent 与复杂工程任务的国产大模型基座。通过本仓库的 Transformers 权重与配置开发者可快速完成 OpenAI 兼容 API 推理、三大推理框架服务化部署、采样参数调优、Agent 工具调用接入以及 LLaMA-Factory / MindFormers 微调与领域定制全面适配国产算力生态与主流开源工具链。赞分享【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型。模型总参数量 29B激活参数仅 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B点击查看免费下载相关推荐Xing4.0-29B-A4B核心亮点一次看懂256K长上下文与4B激活的MoE架构Xing4.0 29B A4B核心亮点一次看懂256K长上下文与4B激活的MoE架构 Xing4.0 29B A4B 是中电信人工智能科技有限公司研发的星辰语Wagtail Sitemap 生成器实战用 wagtail.contrib.sitemaps 为站点构建 XML 站点地图Wagtail Sitemap 生成器实战用 wagtail.contrib.sitemaps 为站点构建 XML 站点地图 本文基于 docs/refereXing4.0-29B-A4B长上下文实战256K窗口处理超长文档的技巧与限制Xing4.0 29B A4B长上下文实战256K窗口处理超长文档的技巧与限制 Xing4.0 29B A4B 是星辰语义大模型系列新一代模型总参数 29B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考