LLM文本标注:一换 prompt 系数就变号?用 DSL 纠偏 温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者李忠彬 (中国人民大学)邮箱lizhongbin0827ruc.edu.cnTitle: LLM文本标注一换 prompt 系数就变号用 DSL 纠偏Keywords: LLM 标注, 测量误差, LLM hacking, DSL, PPI, 设计型抽样, 人工标注提要先用 LLM 给文本打标签再把标签放进回归这在经管研究里已经很常见。我们让 DeepSeek 给 4,838 条带人工标签的金融新闻句子打了三遍标签三套 prompt 的准确率在 80%–85% 之间。同一个回归系数人工标签的结果显著为正换成三套 LLM 标签得到的是显著为负、不显著、不显著。本文从这个例子讲起先说明 LLM 的错误为什么会系统性地带偏系数标签放在回归左边和右边又有什么不同然后介绍 Egami 等 (2023) 的 Design-based Supervised Learning (DSL) 及其与 PPI 的关系最后用 1,000 次重复抽样看校正后的置信区间是否可靠、人工要标多少条。代码与材料DSL 作者 R 包naoki-egami/dsl文档naokiegami.com/dslPPI Python 包aangelopoulos/ppi_py实验数据Financial PhraseBank v1.0CC BY-NC-SA 3.0本文配套代码与 DeepSeek 标注结果ruoshui1zb-dot/llm-annotation-dsl1. 同一批句子三套 prompt三种结论Financial PhraseBank 是一个常用的金融文本情绪数据集 (Malo et al., 2014)。它收录了约 4,800 条英文财经新闻句子由 16 位具有金融背景的标注者3 位研究人员和 13 位金融、会计、经济专业的硕士生从「投资者视角」把每条句子判断为正面、负面或中性。数据集同时公开了标注者之间的一致程度有的句子所有人意见相同有的句子只有一半人同意最终标签。我们把一致程度低于 75% 的句子记为「难判句子」约占全部样本的 28.7%。然后提一个简单的问题难判句子是不是更可能被标注为正面用全部人工标签回归得到的答案是是的。控制句子长度和是否包含数字以后难判句子为正面的概率高出约 8.5 个百分点统计上显著。接下来假装我们没有人工标签让 DeepSeek 用三套 prompt 分别给这 4,838 条句子打标签再跑同一个回归Prompt与人工标签的一致率系数难判句子 → 正面结论人工标签基准—0.085显著为正P1忠实于原始标注手册83.2%−0.096显著为负P2一般情感分析措辞80.2%−0.002不显著P3「好消息还是坏消息」85.3%−0.004不显著三套 prompt 都是正常写法。P1 照着数据集原来的标注手册写按理说最稳妥结果偏得最厉害准确率 83%系数却从显著为正变成了显著为负。放进论文里这三套标签都可以写一句「LLM 与人工标注高度一致」。下面第 2 节解释为什么会这样第 3 节介绍怎样用一小批人工标签做校正第 4 节回到这批句子看校正效果。先交代一下本文和几篇已有推文的关系。《人工标注通过以后LLM 文本变量还要做哪些验证》 讨论了样本划分、误差结构和测量方案的敏感性检验并把「人工验证样本如何正式进入计量推断」留给了后续文章本文接着讨论这个问题。《AI 预测不能直接当真值从 PPI 到 RePPI》 已经详细推导了 PPI 和 RePPI并且主要讨论 AI 预测「结果变量」的情形本文不再重复 PPI 的推导主要讲 DSL。DSL 允许 LLM 生成的变量出现在回归右边也允许研究者有意多抽一些样本去做人工标注。2. 为什么不能直接用 LLM 标签2.1 错误集中在哪里回到上面的实验。把 DeepSeek 的标签与人工标签按「易判 / 难判」分开比较图注左图为 DeepSeek 标签与人工标签的一致率右图为 LLM 标注的正面比例减去人工标注的正面比例负值表示 LLM 少标了正面。数据Financial PhraseBankN 4,838。三套 prompt 在易判句子上的一致率有 88%–93%到了难判句子只剩 60%–66%。LLM 还普遍比人工「保守」正面标得少难判句子上少得更多。以 P1 为例易判句子的正面比例比人工低 6.1 个百分点难判句子低 25.3 个百分点。换句话说LLM 出错多少和「难判」这个变量有关而「难判」恰好是回归里的解释变量。2.2 标签在回归左边误差与 XX 相关就有偏记人工标签为 YiYi​LLM 标签为 Y^iY^i​二者之差为eiY^i−Yi.ei​Y^i​−Yi​.如果直接用 Y^Y^ 做被解释变量OLS 的概率极限为plim β^LLMβ[E(XX′)]−1E(Xe).plim β^​LLM​β[E(XX′)]−1E(Xe).第二项就是用 XX 去回归标注误差 ee 得到的系数。如果 ee 与 XX 无关被解释变量的测量误差只会让标准误变大不产生偏误这是教科书里的结论。LLM 的误差通常不满足这个条件。用图 1 右图的数字可以粗略算一下。在 P1 下难判句子比易判句子多少标了 25.3−6.119.225.3−6.119.2 个百分点的正面于是β^LLM≈0.085−0.192≈−0.107,β^​LLM​≈0.085−0.192≈−0.107,和实际估计的 −0.096−0.096 差不多。P2 和 P3 下这个差距是 8.4 和 9.1 个百分点差不多把 0.085 的真实系数抵消干净。第 1 节表格里的变号和不显著就是这么来的。偏误有多大、朝哪个方向要看误差在不同 XX 之间怎么分布总体准确率说明不了这一点。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。