
1. 从一场深夜争论说起AI辩论为什么总像炼金术士在吵架前几天在一个技术群里有人抛出一个问题“大模型到底有没有‘理解’语言”接下来的两个小时群里分成了两派。一派说模型只是在做概率预测根本不懂语义另一派说人类大脑也不过是神经元放电凭什么说机器就不算理解。吵到最后谁也没说服谁倒是有人甩了一句“这不就是当代炼金术士在争论怎么把铅变成金吗”这句话让我愣了几秒。仔细一想AI领域的很多争论确实和历史上的炼金术有着惊人的相似结构。炼金术士想把贱金属变成黄金AI研究者想把硅基计算变成智能炼金术士有一套复杂的符号体系和操作流程AI从业者也有自己的数学框架和工程实践炼金术士的成果真假难辨AI的能力边界同样充满争议。这个项目标题“What AI debates have to do with alchemy”之所以值得展开是因为它指向了一个很少被认真讨论的元问题我们讨论AI的方式本身是否陷入了某种前科学时代的思维模式这不是一个纯哲学问题它直接影响技术选型、产品设计和团队协作。如果你是一个AI从业者、技术管理者或者只是对AI话题感兴趣但被各种争论搞得头晕的人这篇文章会帮你理清这些争论背后的结构让你在下次遇到类似讨论时能快速判断哪些是真正有价值的分歧哪些只是炼金术式的空转。我打算从四个层面来拆解先讲清楚AI争论和炼金术在结构上的相似性到底体现在哪里再分析这种相似性带来的具体问题然后给出在实际工作中避开这些陷阱的方法最后分享一些我自己在判断AI相关观点时的经验框架。2. AI争论与炼金术的四个结构性相似点2.1 目标模糊都在追求一个无法精确定义的“终极产物”炼金术士追求的是“哲人石”和“黄金”。但如果你去翻中世纪的炼金术文献会发现他们对“黄金”的定义其实很模糊。有的说是一种物理形态的贵金属有的说是一种精神上的完美状态还有的说是一种能够治愈一切疾病的万能药。目标本身没有清晰的操作性定义导致每个人都在朝不同的方向努力却都声称自己在做同一件事。AI领域的“智能”概念几乎是一模一样的处境。你去问十个AI研究者“什么是智能”会得到十种不同的答案。有人说是通过图灵测试的能力有人说是泛化到新任务的能力有人说是压缩信息的能力有人说是与环境的交互能力。更麻烦的是这些定义之间并不完全兼容。一个系统可能在某个定义下表现得很“智能”在另一个定义下却完全不及格。这种目标模糊带来的直接后果是争论双方可能根本不在讨论同一个东西却以为自己在讨论同一个东西。我在实际工作中见过太多次这种情况。产品经理说“我们要做一个智能推荐系统”算法工程师理解的是“提升点击率预测准确率”而用户期望的是“推荐的东西正好是我想要的”。三个“智能”的含义完全不同但开会时大家都在点头。注意当你参与AI相关讨论时第一步永远是确认对方说的“智能”“理解”“推理”具体指什么。不要假设你们在用同一个定义。2.2 方法神秘化复杂术语体系掩盖了实际操作的简单性炼金术文献里充满了“硫汞理论”“四元素说”“转化阶段”之类的术语。这些术语体系极其复杂但如果你剥开来看实际的操作可能就是把几种金属加热、溶解、再结晶。术语的复杂性远远超过了操作本身的复杂性。AI领域也有类似的现象。一个简单的梯度下降优化可以被包装成“基于反向传播的随机优化算法在参数空间中的迭代搜索”。一个线性回归可以被称为“广义线性模型在特定链接函数下的最大似然估计”。这些描述本身没有错但它们制造了一种知识壁垒让外行觉得这些东西高深莫测让内行有时候也被自己的术语绕进去。我并不是说专业术语没有价值。术语的价值在于精确沟通而不是制造神秘感。问题在于当术语体系变得过于庞大和自洽时它就开始脱离实际变成一种内部游戏。炼金术士可以用一套复杂的符号体系解释任何失败——“这次转化失败是因为水星相位不对”——AI从业者也可以用一套复杂的理论解释任何结果——“模型表现不好是因为分布偏移导致泛化误差增大”。听起来很专业但对解决问题没有帮助。2.3 验证困难成功无法复现失败无法归因炼金术士最被诟病的一点是他们声称自己成功把铅变成了金但别人按照同样的步骤却做不出来。而且当实验失败时他们总能找到理由——材料不纯、火候不对、星象不利。这种“不可复现的成功”和“不可归因的失败”是前科学时代的典型特征。AI领域在很多方面也面临同样的困境。一个大模型在某个基准测试上取得了突破其他团队尝试复现却发现结果对随机种子、数据顺序、超参数极其敏感。更麻烦的是当模型表现不好时我们往往无法准确说出原因。是数据问题是架构问题是训练策略问题还是只是运气不好很多时候我们只能给出一些模糊的猜测。这种验证困难带来的一个严重后果是AI领域充斥着无法证伪的主张。有人说“大模型已经具备了推理能力”你让他给出一个明确的、可操作的验证标准他给不出来。有人说“大模型只是在做模式匹配”同样也无法证伪。双方都可以找到支持自己的例子但都无法给出一个决定性的实验来终结争论。2.4 权威依赖用“大师”的判断代替可重复的验证炼金术的传统中师徒传承非常重要。一个著名的炼金术士的笔记和手稿被视为珍宝他的结论被当作权威来引用。这种权威依赖在一定程度上阻碍了独立验证和批判性思维的发展。AI领域也有类似的现象。某些知名研究者的观点被广泛引用某些顶级实验室的论文被视为标杆某些技术大佬的推特被当作行业风向标。这本身不一定是坏事但当权威判断取代了独立验证时问题就出现了。我见过不少团队在技术选型时理由仅仅是“某某大厂就是这么做的”而不是“我们自己的实验表明这个方案更适合我们的场景”。更微妙的是AI领域的权威往往集中在少数几个机构和个人手中。这导致了一种信息不对称权威机构发布的成果被过度解读而独立研究者的工作被忽视。炼金术时代一个默默无闻的工匠可能掌握了更好的技术但因为不在权威体系内他的发现无法传播。今天一个独立研究者可能提出了更好的方法但因为不在顶级机构他的论文可能连审稿都过不了。3. 这些相似性带来的实际问题3.1 技术选型时的“信仰之争”我在实际工作中遇到过很多次这样的情况团队在讨论用哪个模型架构、哪个训练策略、哪个评估指标时争论的焦点不是“哪个方案在我们的场景下表现更好”而是“哪个方案更符合某种理论信念”。比如有人坚信“注意力机制是唯一正确的方向”有人坚信“卷积网络才是正道”有人坚信“强化学习才是通向通用智能的路径”。这些信念本身没有对错但当它们变成不可讨论的前提时技术选型就变成了信仰选择。我见过一个团队花了三个月时间尝试把一个基于Transformer的模型应用到他们的场景中效果一直不好。后来换了一个简单的梯度提升树效果立刻上去了。事后复盘时团队负责人说“我们当时觉得用Transformer才显得‘先进’用传统方法好像就落后了。”这就是炼金术思维——追求“高级”的方法而不是“合适”的方法。3.2 评估标准的主观化炼金术士判断“转化成功”的标准很主观——颜色变了、重量变了、光泽变了都可以说是成功。AI领域也有类似的问题。当我们说一个模型“表现好”时这个“好”的标准是什么是准确率是流畅度是用户满意度还是“看起来像人”更麻烦的是很多AI产品的评估标准是事后定义的。模型先做出来然后找一些指标来证明它好。这和炼金术士先做实验、再找理由解释结果是一样的逻辑。真正的科学方法应该是先定义评估标准再做实验然后看结果是否满足标准。我在做AI产品评估时坚持一个原则评估标准必须在看到结果之前确定而且必须是可以被第三方独立验证的。这个原则听起来简单但在实际操作中很难坚持。因为一旦你看到结果就会不自觉地调整标准来适应结果。3.3 团队协作中的沟通成本当“智能”“理解”“推理”这些词没有统一定义时团队协作的沟通成本会急剧上升。产品经理说“这个功能要智能一点”工程师理解的是“加个推荐算法”设计师理解的是“界面要更简洁”用户期望的是“它能猜到我想要什么”。每个人都在用自己的定义理解同一个词结果做出来的东西谁都不满意。我参与过一个智能客服项目光是“智能”这个词的定义就讨论了两个月。最后我们决定放弃这个词改用具体的功能描述“能够根据用户历史问题自动推荐三个可能的答案”。这个描述虽然不“高级”但所有人都能理解开发效率反而提高了。3.4 对外沟通时的信任危机AI领域的对外沟通也面临炼金术式的困境。当企业宣称自己的产品“具备AI能力”时用户无法验证这个说法的真实性。当研究者宣称自己的模型“取得了突破”时同行无法复现结果。这种信任危机长期来看会损害整个领域的公信力。我注意到一个现象越来越多的用户在听到“AI”这个词时第一反应是怀疑。这不是因为他们不懂技术而是因为他们被太多无法验证的宣称伤害过。这和炼金术士在近代早期面临的信任危机很像——当人们发现炼金术士的黄金其实是黄铜时整个行业的信誉就崩塌了。4. 如何在实际工作中避开炼金术式思维4.1 用操作性定义代替抽象概念避免炼金术式争论的第一个方法是把抽象概念转化为可操作的定义。不要问“这个模型有没有理解语言”而要问“这个模型在什么任务上、用什么指标衡量、达到什么水平算理解”。不要问“这个方案是否先进”而要问“这个方案在我们的数据上、我们的计算资源下、我们的时间限制内表现如何”。我在团队里推行一个规则任何技术讨论中出现的抽象概念必须当场给出一个可操作的定义。如果给不出来这个词就不能作为讨论的基础。这个规则一开始让很多人不适应但坚持下来后会议效率明显提高。4.2 建立可复现的实验流程炼金术的核心问题是不可复现。解决方法是建立严格的实验流程固定随机种子、记录所有超参数、保存训练日志、使用版本控制、进行多次重复实验。这些做法在工程上并不复杂但需要纪律。我自己的实验流程是这样的每次实验前先写一个实验计划包括假设、变量、评估指标、预期结果。实验后记录实际结果和计划的差异。如果结果和预期不符先检查实验流程是否有问题再考虑理论解释。这个流程看起来繁琐但它能有效防止“事后找理由”的炼金术式思维。4.3 区分“工程问题”和“科学问题”很多AI争论之所以陷入僵局是因为把工程问题和科学问题混在一起了。工程问题是“在给定约束下如何达到目标”科学问题是“现象背后的机制是什么”。工程问题有明确的成功标准科学问题没有。比如“如何提升模型在特定任务上的准确率”是工程问题可以通过实验来回答。“模型为什么能提升准确率”是科学问题可能需要长期研究。把工程问题当成科学问题来讨论就会陷入无休止的争论。把科学问题当成工程问题来处理就会满足于表面效果而忽略深层理解。4.4 培养“可证伪”的思维习惯可证伪性是科学和炼金术的分界线。一个可证伪的主张必须明确指出在什么条件下它会被推翻。比如“这个模型在分布内数据上表现良好”是可证伪的因为你可以测试分布外数据。“这个模型具有推理能力”是不可证伪的因为无论它表现如何你都可以说“它只是在做模式匹配”或者“它的推理方式和人不一样”。我在评估AI相关主张时会问三个问题第一这个主张在什么条件下会被证明是错的第二有没有人做过这样的测试第三如果测试结果不支持这个主张主张者会接受吗如果三个问题的答案都是模糊的这个主张就值得警惕。5. 一个实用的判断框架炼金术指数基于上面的分析我整理了一个简单的判断框架用来评估一个AI相关主张或争论是否陷入了炼金术式思维。我把它叫做“炼金术指数”从五个维度来打分每个维度1到5分总分越高越接近炼金术。维度1分科学思维5分炼金术思维目标定义有明确的操作性定义依赖模糊的抽象概念验证方式可复现、可证伪不可复现、不可证伪证据标准独立第三方可验证依赖权威或个案失败归因有系统的排查流程事后找理由解释沟通语言具体、可操作术语堆砌、神秘化使用这个框架时不需要追求低分因为AI领域本身就有很多未解之谜一定程度的模糊是正常的。但如果总分超过20分就说明这个讨论可能已经陷入了炼金术式的空转需要及时调整方向。我自己的经验是在团队讨论中引入这个框架后大家开始有意识地检查自己的表述。比如当有人说“这个模型更聪明”时会有人追问“聪明具体指什么”。这种追问一开始可能让人不舒服但长期来看它让讨论变得更有效率。6. 几个常见问题的快速排查在实际工作中我遇到过很多次类似的情况下面整理成速查表方便你快速定位问题。现象可能的原因排查方向讨论陷入僵局双方各执一词核心概念没有统一定义回到操作性定义确认双方说的是不是同一件事实验结果无法复现随机性未控制或记录不完整检查随机种子、数据顺序、超参数记录模型效果时好时坏评估标准不固定或数据分布变化固定评估流程监控数据分布团队对方案选择争议大工程问题和科学问题混淆区分“能不能做到”和“为什么能做到”对外沟通被质疑主张不可证伪或缺乏独立验证提供可复现的实验结果和明确的评估标准提示这张表不是万能的但它能帮你快速判断问题出在哪个层面。大多数AI争论的根源都在第一行——概念定义不统一。7. 我个人的一些经验体会说了这么多最后分享几点我自己的体会。这些不是理论推导出来的而是在实际工作中踩坑踩出来的。第一不要害怕说“我不知道”。AI领域有太多未解之谜承认自己不知道不是软弱而是诚实。炼金术士的问题之一就是他们从不承认自己不知道总是用复杂的理论解释一切。保持谦逊承认边界反而能让你更接近真相。第二重视简单的方法。我见过太多团队一上来就追求最先进的模型结果忽略了数据质量、特征工程、评估流程这些基础工作。很多时候一个干净的逻辑回归比一个调参不当的深度网络效果更好。炼金术士追求的是“高级”的转化方法但真正有用的往往是那些简单、可理解、可控制的方法。第三建立自己的实验记录习惯。我从开始做AI项目起就坚持记录每次实验的细节用了什么数据、什么参数、什么环境、结果如何、和预期有什么差异。这些记录当时看起来没什么用但当我需要回溯问题、复现结果、或者向别人解释时它们就是最宝贵的资料。炼金术士的笔记之所以神秘是因为他们故意写得晦涩。我们的笔记应该反过来写得越清楚越好。第四对“突破性进展”保持警惕。每当看到“颠覆性”“革命性”“前所未有”这样的词时我的第一反应是找证据。不是说不相信进步而是说真正的进步往往是一点一点积累的不是一夜之间发生的。炼金术士喜欢宣称自己找到了终极答案但科学的历史告诉我们终极答案往往不存在只有不断逼近的过程。第五多和不同背景的人交流。AI领域的争论之所以像炼金术部分原因是参与者往往来自相似的背景有相似的知识结构容易形成回音室。和产品经理、用户、其他领域的工程师交流能帮你跳出术语体系看到更实际的问题。我很多次在和非技术背景的人聊天时突然意识到自己一直在纠结的问题其实不重要。这个标题“What AI debates have to do with alchemy”看起来是个哲学话题但它对实际工作的指导意义比想象中大得多。当你意识到很多争论其实是炼金术式的空转时你就能把精力集中在真正重要的问题上定义清楚目标、建立可复现的流程、用证据说话、保持谦逊和开放。这些原则不新鲜但真正做到的人不多。希望这篇文章能帮你在下次遇到AI争论时多一份清醒少一份迷茫。