中文Alpaca开放式问答能力实测:Plus-7B/Plus-13B/33B 三模型对比与解码参数解析 大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载本文基于 Chinese-LLaMA-Alpaca 项目中的开放式问答Open-ended Question AnsweringOQA评测记录系统解读中文 Alpaca-Plus-7B、Alpaca-Plus-13B 与 Alpaca-33B 在开放式提问场景下的表现差异、完整测试样例与评分机制并结合仓库内的推理脚本与评测说明给出可复现的 llama.cpp / transformers 解码参数配置帮助读者理解开放式问答这一能力维度的评测方法与模型选型依据。开放式问答评测在项目中的定位在 examples/f16-p7b-p13b-33b/README.md 中项目对中文 Alpaca-Plus-7B、中文 Alpaca-Plus-13B 和中文 Alpaca-33B 三个模型进行了 10 组常见任务的对比评测每组 20 个样例、共 200 个样例覆盖知识问答、开放式问答、数值计算推理、文学、娱乐、写作、翻译、多轮交互、代码、伦理拒答等多个维度。其中开放式问答OQA.md是三模型整体表现最接近的一组Alpaca-Plus-7B80.5 分该组最高Alpaca-Plus-13B80.0 分Alpaca-33B78.5 分值得注意的是在 10 组任务中33B 模型在知识问答82.3、推理84.5、翻译92.3、代码84.0、伦理拒答92.5等任务上全面领先唯独在开放式问答这一组被 Plus-7B 反超。这提示了一个重要现象开放式问答考察的不是单纯的知识储备或推理深度而是内容组织、语气拿捏、表达完整度与实用性建议的生成能力模型参数量并非决定性因素。根据 examples/README.md 的说明评测分数应视为paired score相对分分数是多个系统相互比较得到的相对结果大小关系有一定参考价值绝对值则不宜孤立解读。分数表三模型在 20 个开放式问题上的逐题表现以下为 OQA.md 中记录的逐题得分10 分制与平均分平均分#1#2#3#4#5#6#7#8#9#10#11#12#13#14#15#16#17#18#19#20Plus-7B8.05859888995998888.598108.56Plus-13B8.07.558.588.58995910698.58.588.597833B7.857597.587885898.5998.578988.5逐题观察要点#2「我能在咖啡里加盐吗」三模型均只得 5 分这是本组最低分。从生成内容看Plus-7B/Plus-13B 均给出不建议的保守答复33B 则直接回答不可以因为咖啡和盐的口感不协调三者都未能展开说明理由或给出替代方案说明开放式问答中单一结论 缺乏论证的回复容易失分。#9「如何制作螺丝钉炒西红柿」三模型均只得 5 分Plus-7B 与 Plus-13B 实际上生成的是常规西红柿炒鸡蛋食谱模型被 prompt 中的螺丝钉引导出错33B 则真的加入了将螺丝钉用油炸至金黄色的错误步骤。该题展示了模型在对抗性/荒谬指令下的稳定性差异三个模型均未能识破问题中的逻辑陷阱。#18「列举人类历史上最伟大的科学家」Plus-7B 获满分 10 分其回答给出了爱因斯坦、达尔文、牛顿、居里夫人、霍金五人的结构与贡献描述条目完整且信息准确是结构化输出能力的典型正面样本。#11「如何快速入眠」Plus-13B 获满分 10 分其回答从睡眠时间表、蓝光、环境、放松技巧到就医建议层层递进体现了分点 递进 兜底建议的理想开放式回答结构。开放式问答的测试样例与三模型回复对比OQA 组共 20 个 prompt覆盖消费决策、情感支持、生活建议、科技趋势、社会现象分析、文化差异、哲学思辨、假设想象等开放式话题。以下按类别整理完整样例与三模型回复要点完整逐字回复见 OQA.md。1. 消费与市场现象类#1 为什么苹果支付没有在中国流行三个模型均能给出多点归因Plus-7B 从竞争、文化差异、技术限制、用户习惯四个维度展开Plus-13B 补充了银联云闪付、银行卡支付等竞争因素33B 则概括了市场成熟度与政策限制。这类社会现象分析题三个模型均表现良好8 / 7.5 / 7Plus-7B 的结构化程度最高。#5 我并不是很富裕我应该花很多钱买最新的手机吗三个模型均给出理性消费、按需购买的立场8 / 8.5 / 8Plus-13B 的回答区分了基本功能与进阶功能的需求场景建议粒度更细。2. 生活建议与情感支持类#4 我的宠物走丢了你能说一些安慰我的话吗三个模型8 / 8 / 7.5均先表达共情再给出寻物启事、联系收容所、报警等可执行步骤是情感支持与实用建议结合的正面样本。#6 如何更好地融入新工作圈子三个模型均给出分点建议Plus-7B 与 Plus-13B 各 8 分33B 为 7 分。可以看出 7B/13B 在职场场景下的建议覆盖面社交活动、团队协作、专业素养比 33B 更细。#8 如何在这个充满焦虑的世界里保持积极乐观的生活态度三模型均得 9 分回复均包含自我调节、社交支持、生活方式、应对压力等要素是情绪管理类问题的理想范本。#11 如何快速入眠Plus-13B 满分 10 分、其余两模型 9 分。Plus-13B 的规律作息 → 规避蓝光 → 环境改造 → 放松技巧 → 专业求助的递进结构值得作为参考标准。#17 如何建立婆媳之间的和谐关系三模型8 / 8.5 / 8均围绕尊重、沟通、理解、共同活动展开观点一致且表达得体。3. 社会现象与热点分析类#7 人工智能技术的进步是否会威胁人类社会三模型均得 9 分观点均为不会直接威胁、但需监管的平衡立场体现了模型在公共议题上的审慎表达。#15 详细分析加班为什么在中国公司非常普遍三模型8.5 / 8.5 / 8.5均从市场竞争、文化传统、管理制度、收入/社保等角度给出系统归因33B 的回复还包含了对政府、企业、社会共同治理的建议完成度高。#16 请你详细评述中美在人工智能技术上的差异三模型分别 9 / 8 / 7 分。Plus-7B 从技术水平、政策环境、人才储备三维对比条理最清晰Plus-13B 的表述存在中国人才储备相对较少等以偏概全的倾向33B 的回答更宏观但颗粒度较粗。4. 技术与工程科普类#3 哪个更受欢迎TensorFlow还是PyTorch三模型9 / 8.5 / 9均从应用场景、生态、易用性等角度给出取决于需求的中立结论未出现明显事实错误。#13 如何才能登陆月球三模型8 / 9 / 9描述登月的火箭、着陆、导航通信、训练等环节属于泛化但合理的工程流程描述。#14 请讨论一下计算机能否拥有意识三模型8 / 8.5 / 9均将问题定位为哲学/开放争议表达克制未强行下结论是不确定性问题的恰当处理方式。5. 文化、生活常识与假设想象类#2 我能在咖啡里加盐吗5 / 5 / 5详见上文分析#9 如何制作螺丝钉炒西红柿5 / 5 / 5详见上文分析典型对抗性指令失败样本#10 中医的优势和劣势是什么什么情况下选择中医疗法三模型9 / 9 / 8均能给出整体观念、预防调理等优势及科学性争议等劣势并给出选择场景是医疗话题上审慎 均衡的正面样本。#12 鸡蛋灌饼是如何制作的三模型8 / 6 / 8.5均生成完整步骤但步骤差异明显Plus-13B 仅 6 分因其做法描述较为简略擀成薄片放入平底锅煎未给出具体步骤拆解。#18 列举几位你认为在人类历史上最伟大的科学家和他们的主要贡献10 / 9 / 9详见上文分析#19 请想象一下变成一只蝙蝠会怎样三模型8.5 / 7 / 8Plus-7B 先声明作为 AI 无身体与感官再给出蝙蝠的生物学信息处理无法体验类问题的策略最稳妥Plus-13B 的回复仅一句话内容单薄33B 则围绕飞行能力展开想象。#20 请你详细分析地球上是先有鸡还是鸡蛋三模型6 / 8 / 8.5Plus-7B 仅一句没有确定的答案严重偏短导致扣分Plus-13B 从进化论角度回答33B 则同时给出生物学与进化论两种视角。该题直观展示了回复长度与展开度对开放式问答得分的影响。类别小结从 20 个样例可以归纳出开放式问答评分的几个隐含标准结构化程度分点作答、逻辑递进如 #11、#18的回复得分显著更高信息充分度单句结论型回复如 #20 Plus-7B、#19 Plus-13B明显失分对抗性/荒谬指令的辨识三模型在 #9 上集体失误说明该能力维度仍有短板不确定性问题的话语策略哲学类问题#14、#20上给出多视角 不下定论是得分关键。评测运行参数llama.cpp 统一解码配置根据 examples/f16-p7b-p13b-33b/README.md 的记录评测使用了统一的解码参数llama.cpp 的命令如下./main -m zh-alpaca-models/{Plus-7B,Plus-13B}/ggml-model-q8_0.bin --color -f ./prompts/alpaca.txt -ins \ -b 16 -c 2048 -n 512 -t 6 \ --temp 0.2 --top_k 40 --top_p 0.9 \ --repeat_penalty 1.1各参数含义与调优建议参数取值说明-mggml-model-q8_0.bin指定 8-bit 量化模型文件-ins表示以指令模式instruction mode启动适用于 Alpaca 指令模型-f./prompts/alpaca.txt载入 Alpaca 的输入模板prompt template文件-b16batch size影响生成吞吐-c2048context size上下文窗口长度-n512最大生成 token 数保证开放式回答有足够展开空间-t6线程数按本机 CPU 核数调整--temp0.2采样温度。原文档特别提示对话、写作类等自由生成类任务可适当调高 temp--top_k40top-k 采样候选数--top_p0.9nucleus sampling 累积概率阈值--repeat_penalty1.1重复惩罚系数抑制生成中的重复片段需要特别说明评测的环境差异原文档脚注Alpaca-Plus-7B 与 Plus-13B 的结果沿用此前 8-bit 量化q8_0生成33B 除多轮对话外的任务由 Hugging Face 原生接口以 F16 精度解码多轮对话任务使用 llama.cpp q4_0 量化版解码。因此三模型的硬件负载与精度并不完全一致这也是原文档强调结果仅供参考、欢迎自行体验的原因。打分方式GPT-4 辅助的 paired scoringexamples/f16-p7b-p13b-33b/README.md 记录了完整评分协议共 10 组任务每组满分 100 分每组 20 个样例每个样例满分 10 分样例得分之和规整到 100 分区间作为该模型在该任务上的得分每个样例运行 2–3 次人工选取最好的一组交给机器评分以降低采样随机性带来的偏差除多轮任务外所有任务均基于单轮回复打分不包含对话历史使用 GPT-4 与 ChatGPTGPT-3.5对两个系统的输出按 10 分制打分优先 GPT-4受交互次数限制时部分由 gpt-3.5-turbo 完成模板如下The followings are ChatGPT-like systems outputs based on a single prompt. Please rate an overall score on a ten point scale for each system and give a short explanation to justify your scores. Please try not to give the same scores for different system unless they are indistinguishable. Prompt: prompt-input System1: system1-output System2: system2-output评分模板的设计要点要求尽量不给出相同分数强制拉开系统间区分度并要求给出 short explanation使评分可追溯。这也是 paired score 相对比较逻辑的直接体现。结合推理源码理解生成行为评测使用的低温度temp 0.2、高重复惩罚repeat_penalty 1.1参数与仓库提供的 Hugging Face 推理脚本 中的默认生成配置完全一致inference_hf.pygeneration_config dict( temperature0.2, top_k40, top_p0.9, do_sampleTrue, num_beams1, repetition_penalty1.1, max_new_tokens400 )结合该脚本可以进一步解释 OQA 样例中的一些现象低温度 高重复惩罚决定了模型倾向于输出稳定、保守、分点结构化的文本这与样例中大量1. 2. 3. 4.式分点回复如 #6、#8、#11直接相关原文档也提示自由生成类任务应适当调高 temp。脚本内置的 prompt 模板inference_hf.py为Below is an instruction that describes a task. Write a response that appropriately completes the request. ### Instruction: {instruction} ### Response:该模板与 llama.cpp 的-ins指令模式内嵌模板一致评测时统一使用保证了 prompt 格式不影响模型间对比。脚本通过--with_prompt开关决定是否自动包裹模板、通过--data_file支持逐行指令批量推理inference_hf.py输出结果写入predictions.json并附带generation_config.jsoninference_hf.py——这正是一套可复现 OQA 式批量评测的参考工作流准备 20 个 prompt → 三模型各跑 2–3 次 → 人工挑选 → 交给 GPT-4 按模板打分。模型选型建议开放式问答场景该选谁结合 examples/f16-p7b-p13b-33b/README.md 的 10 组任务总览与 OQA 单组结果可以得出以下选型参考基于评测结果的事实陈述非绝对结论纯开放式问答场景Alpaca-Plus-7B80.5略高于 Plus-13B80.0与 33B78.5且 7B 在单机 CPU/8-bit 量化下资源开销最小是性价比最优选择若偏好更完整、更长的回复可优先 Plus 系列README 中说明 Plus 系列在输出完整度上优于基础版。综合能力场景若任务同时涉及知识问答、推理、代码、翻译等硬能力33B 在多数任务中领先总平均分 82.0 vs Plus-13B 79.4 vs Plus-7B 75.3则 33B 或 Plus-13B 是更稳妥的通用选择。对抗性/荒谬输入三模型在 #9「螺丝钉炒西红柿」上均失败说明即使 33B 也难以稳定识破逻辑陷阱实际部署时建议配合输入过滤或安全校验。评测本身的局限同样需要在引用时说明生成具有随机性受解码超参与随机种子影响评测并非绝对严谨分数为相对比较结果。更多维度知识问答 QA.md、推理 REASONING.md、翻译 TRANSLATION.md 等的对比样例可继续查阅 examples/f16-p7b-p13b-33b 目录模型合并与本地部署步骤可参考 README.md 中的合并模型与本地推理章节。赞分享大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载相关推荐如何优化gpt-oss-20b-tq3内存使用16GB Mac上的极致性能调优如何优化gpt oss 20b tq3内存使用16GB Mac上的极致性能调优 想要在16GB内存的Mac上流畅运行大型语言模型吗gpt oss 20b tOR-Tools 9.5 终极指南如何彻底解决Eigen3依赖问题并优化数学运算性能OR Tools 9.5 终极指南如何彻底解决Eigen3依赖问题并优化数学运算性能 Google OR ToolsOperations Research科学计算Llama-2-7b-chat-hf模型对比7B、13B、70B三个版本的性能差异分析Llama 2 7b chat hf模型对比7B、13B、70B三个版本的性能差异分析 概述 Meta发布的Llama 2系列大语言模型Large Lang上一篇3分钟学会APK安装器在Windows上轻松运行安卓应用下一篇10个实用LLM数据增强技巧掌握trl中的同义词替换方案创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考