3种分词路线任选,GPT2-Chinese 中文文本生成实操指南 3种分词路线任选GPT2-Chinese 中文文本生成实操指南【免费下载链接】GPT2-ChineseChinese version of GPT2 training code, using BERT tokenizer.项目地址: https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese想让模型接着金庸小说往下写或给一句梅山如积翠让它续出整首七律GPT2-Chinese 就是为中文文本生成准备的 GPT-2 训练代码。它基于 HuggingFace Transformers 实现既能拿自己的语料训练模型也备了诗词、对联、歌词等现成模型可以直接生成。把 GPT-2 搬进中文场景它动了哪三处GPT-2 原生按英文设计直接拿来训中文并不顺手这个项目的核心工作集中在三块train.py训练入口内置 FP16 混合精度与梯度累积开关fp16 可能不收敛先小步测试再开generate.py生成入口top-p、temperature 等采样参数都能调tokenizations/默认 BERT 分词器之外备有分词版 BERT 和 Sentencepiece BPE 两套备选字级、词级、BPE 三种分词方案怎么选字级默认 BERT tokenizer不用自己分词原文直接丢进语料就行上手最快词级语料先分词适合长篇小说建议先用 make_vocab.py 给语料建一份专属词表BPE需要自己建中文词表且要略改 train.py适合想贴近 GPT-2 原始做法的人语料不大时字级足够小说这类超长文本走词级序列更短、训练更快。从 train.json 到出文本两条命令就够第一步在项目根目录建 data 文件夹放入 train.json——一个 JSON 列表每个元素是一篇文章的全文不是文件路径。第二步运行python train.py --raw自动预处理后直接开训scripts 目录 里有现成的训练与生成配置可抄。训完用 generate.py 出文本--prefix 给开头--length 控制生成长度加 --save_samples 结果存进 samples.txt。整本超大小说交给 train_single.py想从一组关键词批量生成句子用 generate_texts.py评估模型好坏看 eval.py 的 ppl 分数。7 套现成模型哪套适合你的题材仓库的模型分享列表里有 7 套散文130MB 名家散文、诗词约 80 万首、对联约 70 万条语料按上联-下联组织、通用中文与通用中文小模型CLUECorpusSmall 训练、歌词约 15 万首、文言文约 300 万篇用法上有一个统一细节生成时输入文本前要先加起始符 [CLS]。给诗词模型续写输入要写成[CLS]梅山如积翠。先尝鲜还是自己训按需求走只想看效果拿诗词或对联模型给一句开头直接生成有自己的语料小说、新闻、散文整理成 train.json 交给 train.py想读代码核心就 train.py、generate.py、eval.py 三个文件结构清爽适合琢磨中文文本生成的实现语料整理成 train.json 交给它分词、训练、生成一条龙都替你搭好了这是 GPT2-Chinese 最省心的地方。代码获取git clone https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese【免费下载链接】GPT2-ChineseChinese version of GPT2 training code, using BERT tokenizer.项目地址: https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考