Self-Correcting Large Language Models: Generation vs. Multiple Choice 文章总结与翻译一、主要内容本文围绕大型语言模型(LLMs)的自校正机制展开系统性研究,核心对比了开放式生成(自由文本创作,如对话生成、代码优化)与多项选择(从预定义选项中挑选答案,如知识问答、推理题)两种任务范式下自校正的动态差异。核心研究内容任务范式定义:开放式生成:无约束词汇序列生成,输出空间灵活但搜索范围大,存在语义偏移和幻觉风险;多项选择:固定候选答案集的分类任务,输出边界清晰,稳定性强但受限于选项范围。实验设计:数据集:采用DISAMBIGUATIONQA(指代消解任务)和TINYTRUTHFULQA(事实性问答任务),均支持两种范式的平行测试;模型:覆盖6种不同规模和家族的LLMs(从1.7B到14B+参数,如SmolLM2-1.7B、Gemini-2.0-Flash等);提示策略:对比基准提示(Baseline)、思维链提示(CoT)和自一致性迭代优化(SC)三种方式,最多迭代5轮。关键发现:开放式生成:前1-2轮迭代快速修正错误,性能显著提升,但后续迭代易因语义偏移导致性能停滞或下降;多项选择:迭代改进平缓