Transformers 库快速上手指南:一套代码接入 500+ 模型架构的推理与训练 Transformers 库快速上手指南一套代码接入 500 模型架构的推理与训练【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers想在本地跑通一个模型的推理和微调却不想为每个架构重写一遍代码Transformers 库把这件事压缩成了几条 API 调用这个 Hugging Face 开源项目内置 500 多个模型架构定义覆盖文本、视觉、音频与多模态用统一 API 同时支撑推理与训练。它解决什么问题过去每接入一个新模型架构往往要各自处理分词器、权重加载、预处理和数据流代码互不通用换框架更是重新来过。Transformers 的思路是模型定义集中化所有架构的定义由这一个库统一维护作为整个生态的枢纽。官方说明中只要一个模型定义被 transformers 支持它就自动与主流训练框架DeepSpeed、FSDP、PyTorch-Lightning 等、推理引擎vLLM、SGLang、TGI 等以及周边生态保持兼容。对开发者来说这意味着新架构发布后你不需要读论文级实现几条调用就能先跑起来验证想法。关键数字507 个模型架构定义src/transformers/models/下的架构目录数100 万个可在 Hugging Face Hub 直接加载的预训练 checkpoint运行要求Python3.10、PyTorch2.5用户侧抽象仅3 个核心类Pipeline、PreTrainedModel、PreTrainedTokenizer一套 API 覆盖所有模态快速上手环境依赖Python 3.10 及以上PyTorch 2.5 及以上建议用 venv 或 uv 建虚拟环境安装步骤# pip 或 uv 二选一 pip install transformers[torch] # uv pip install transformers[torch]如需最新开发版或参与贡献从源码安装git clone https://gitcode.com/GitHub_Trending/tra/transformers cd transformers pip install .[torch]最简推理示例官方 Quickstart 推荐从Pipeline高层 API 开始3 行完成一次文本生成模型权重会自动下载并缓存复用from transformers import pipeline pl pipeline(tasktext-generation, modelQwen/Qwen2.5-1.5B) pl(the secret to baking a really good cake is )此外还可以直接在命令行与模型对话transformers chat Qwen/Qwen2.5-0.5B-Instruct。工作原理模型定义集中化transformers 是整个生态的枢纽层训练框架、推理引擎和 llama.cpp、mlx 等周边库复用它的模型定义架构只维护一份统一 from_pretrained 入口模型、分词器、处理器共用一套加载接口自动下载、缓存权重默认采用 safetensors 格式屏蔽了各架构之间的差异v5 动态权重加载新版引入WeightConverter加载 checkpoint 时可对张量做 reshape、合并、拆分例如把 q/k/v 投影融合为 qkv让量化、张量并行等变换在加载期完成加载和保存也可逆v5 聚焦单一后端移除了 TensorFlow 与 JAX 实现全面转向 torch降低每个模型的维护成本详见 MIGRATION_GUIDE_V5.md训练默认参数一览以下为 src/transformers/training_args.py 中TrainingArguments的默认值按需调整即可每设备 batch size8训练轮次3.0 epoch学习率5e-5线性衰减调度器lr_scheduler_type 默认 linear优化器AdamWbetas(0.9, 0.999)epsilon1e-8梯度裁剪 max_grad_norm1.0各架构的完整训练入口可参考 examples/pytorch/ 下的任务目录text-generation、summarization、translation 等。适用场景产品团队接入生成能力上线对话或文案功能时用 Pipeline 几行代码验证候选模型效果不必先搭一套训练管线研究者做领域微调拿到领域数据后配合 src/transformers/trainer.py 的 Trainer 做少样本或全量微调examples/pytorch/ 提供每个任务的现成脚本作起点工程师处理多模态任务ASRWhisper、图像分类DINOv2、视觉问答BLIP等任务共用同一套调用模式切换模态只需换 task 和 model 两个参数性能工程团队做部署优化借助 v5 的权重加载 API 处理量化与张量并行场景docker/ 提供了 GPU、AMD GPU、TPU、量化等十余个现成镜像仓库速览src/transformers/pipelines/各模态任务28 个的 Pipeline 实现src/transformers/modeling_utils.pyfrom_pretrained权重加载与模型基类src/transformers/models/507 个模型架构目录每个含 configuration 与 modeling 文件src/transformers/trainer.py 与 src/transformers/training_args.py训练主循环与超参数配置src/transformers/generation/自回归生成、连续批处理continuous batching、流式输出src/transformers/tokenization_utils_base.py分词器基类与加载逻辑src/transformers/cli/transformers chat、serve、download等命令行工具docker/PyTorch GPU、DeepSpeed、TPU、量化等场景镜像MIGRATION_GUIDE_V5.mdv5 版本迁移说明移除 TF/JAX、新权重加载 APIdocs/source/en/官方文档源码写在最后Transformers 的价值在于把接入一个模型的成本压到最低统一模型定义、一套加载 API、507 个架构开箱即用。v5 方向也很明确——砍掉多后端包袱、用可逆的权重变换支撑量化与并行让推理和训练共用同一条代码路径。挑一个你的任务类型按上面的最简示例先把 pipeline 跑起来剩下的调参和扩展路径仓库里都有现成参考。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考