
最近AI圈子里有个讨论挺有意思不是关于某个新模型刷榜也不是关于某个技术突破而是关于一个更“人性化”的话题幽默感。起因是Meta的首席AI科学家杨立昆Yann LeCun在一次访谈中被问及AGI通用人工智能是否会有幽默感时他半开玩笑地回应大意是“如果AGI有幽默感那它可能会觉得我们人类的笑话一点都不好笑”。这句话看似调侃却在社交媒体和技术社区里引发了不少涟漪。很多人把这当作一句轻松的玩笑但如果你仔细琢磨会发现这句话背后其实藏着一个非常严肃的、关于AGI本质的追问我们到底在期待一个什么样的“智能”是一个能完美执行指令、解决复杂问题的超级工具还是一个能理解、甚至能创造人类文化中那些微妙、模糊、充满主观色彩的“意义”的伙伴幽默感恰恰是后者一个绝佳的试金石。它不像下围棋或写代码有明确的规则和胜负标准。幽默依赖于语境、文化背景、社会共识甚至是一瞬间的情绪状态。一个AI能识别出“笑话”这个文本类别和它真正“觉得”某个笑话好笑中间隔着一条巨大的认知鸿沟。所以当我们在谈论AGI的“幽默感”时我们其实是在问AI能否跨越从“模式识别”到“意义理解”的这道坎这不仅仅是技术问题更是一个关于智能本质的哲学和工程学交叉问题。今天我们就借着这个话题深入聊聊当前多模态AGI在理解“意义”这件事上走到了哪一步真正的难点在哪里以及我们作为开发者或使用者应该如何更务实地看待和利用这些能力。1. 幽默感AGI路上那块最滑的“香蕉皮”为什么偏偏是幽默感成了检验AGI成色的一个有趣标尺因为它几乎集齐了高级认知挑战的所有要素。1.1 它不是单一任务而是认知的“综合体操”想想你看懂一个高级梗需要什么语言理解听懂字面意思。这已经是NLP的经典难题但只是起点。世界知识梗往往涉及历史事件、流行文化、名人轶事。比如“程序员掉进水里为什么不会淹死因为他会Csea”。你需要知道C是一种编程语言并且和“sea”海谐音。逻辑推理与意外违背笑话的核心结构通常是“建立预期 - 意外打破”。大脑需要先沿着常规逻辑走然后在笑点处瞬间完成逻辑转折。AI需要模拟这个“预期-违背”的心理过程。社会与文化语境很多幽默依赖于共享的社会规则或文化禁忌。在一个文化里好笑的事在另一个文化里可能是冒犯。AI需要理解这套无形的“背景板”。情感与意图揣测说话者是善意调侃还是恶意讽刺是自嘲还是嘲他这需要理解说话者的意图和情感状态。多模态融合如果是段子视频或漫画还需要结合视觉信息表情、动作、场景来理解笑点。当前最先进的多模态大模型比如GPT-4V、Gemini等在1和2上已经做得相当不错在6上也有长足进步。它们可以描述一个笑话的构成甚至生成一个符合笑话模板的文本。但问题在于这依然是“模式匹配”和“统计生成”。模型学到了海量互联网文本中“笑话”的常见模式比如谐音、双关、反转然后依样画葫芦。它并不真正“理解”为什么这个反转会引人发笑也不具备那种“觉得”好笑的内在体验。1.2 “理解”与“生成”的鸿沟从鹦鹉学舌到会心一笑这就引出了当前AI能力的一个核心边界它擅长“模仿形态”但难以“把握神韵”。我们可以让AI完成以下任务并且完成得很好识别“这是一段幽默文本。”解释“这个笑话使用了谐音双关将编程语言‘C’与单词‘sea’关联制造了意外。”生成根据指令“生成一个关于程序员的谐音笑话”它可能产出“为什么程序员总分不清万圣节和圣诞节因为 Oct 31 Dec 25。”这是一个真实的编程梗基于八进制和十进制的转换。但是如果你问它“你觉得这个笑话好笑吗为什么”它的回答本质上是对训练数据中人类评价的归纳总结而不是基于自身“感受”的判断。它没有“觉得”这个状态。杨立昆的调侃之所以犀利就在于他点破了这一点一个真正拥有高级智能的AGI其幽默的“阈值”和“点”可能和人类完全不同。它可能觉得人类纠结的许多事情比如这个谐音梗极其幼稚而一些人类无法理解的、关于宇宙数学之美的“笑话”才能让它“会心一笑”。所以讨论AGI的幽默感其实是在讨论智能体主观体验和价值对齐的终极问题。我们是在试图创造一个“像我们一样思考”的智能还是一个“思考方式我们无法完全理解但能有效协作”的智能2. 多模态AGI的现状我们站在“意义之山”的哪一级抛开哲学思辨回到工程现实。当前以大型语言模型LLM和多模态模型为核心的技术路径在通向“理解意义”的道路上已经攀登了哪些台阶又卡在了哪些峭壁前2.1 已征服的“丘陵”强大的模式关联与信息整合我们必须承认进步是巨大的。今天的多模态模型已经不再是简单的“看图说话”工具。跨模态精细关联给定一张复杂的网络梗图比如“迷惑行为大赏”模型能清晰地描述图中各个元素人、物、动作并将图片中的视觉元素与可能的文本梗、流行语联系起来生成一个逻辑通顺、甚至有点“网感”的描述。这背后是千亿级参数对图像-文本对数据中复杂关联模式的记忆与泛化。上下文情境推理在一段连续对话中模型可以结合之前的对话历史理解当前问题中的指代和隐含意图。例如你之前聊过足球现在发一张梅西摔倒的图片并说“哈哈哈”模型能推断出你是在对某个具体的比赛瞬间或梅西的经典动作表示幽默。知识图谱的隐式调用虽然不像传统符号AI那样显式调用知识库但大模型内部形成了类似知识图谱的关联结构。当处理涉及文化背景的笑话时它能激活相关的知识节点。这些能力让AI在表现上越来越接近“理解”。许多应用场景已经受益匪浅比如更智能的图文创作助手能根据粗略的文案梗概生成风格匹配的图片或者为图片配上有趣的文案。交互式娱乐与游戏NPC的对话可以更自然、更贴合情境甚至能接一些简单的梗。内容审核与理解能更准确地识别带有反讽、调侃等复杂语义的违规内容。2.2 眼前的“峭壁”缺乏物理模型与持久心智然而杨立昆等学者反复指出当前基于LLM的路径存在根本性局限阻碍了其迈向真正的“理解”。两个核心短板是1. 缺乏对物理世界的内在模型Internal World Model人类理解幽默尤其是情景喜剧或肢体幽默依赖于我们对物理世界运行规律重力、碰撞、液体飞溅等和他人意图的直觉预测。我们看到一个人踩到香蕉皮滑倒之所以会笑在非恶意的情况下部分原因是我们的大脑瞬间模拟了“踩中-失衡-摔倒”这个违反正常运动预期的过程并识别出其中无害的意外性。当前的多模态模型没有这种“物理直觉”。它通过海量数据“看到”过无数张“踩香蕉皮摔倒”的图片和描述知道这常与“滑稽”、“倒霉”等标签共存。但它并不“知道”香蕉皮为什么滑、人体重心如何变化。它的理解是统计关联而非因果模型。因此对于完全新颖的、需要物理推理的幽默场景它的表现会不稳定。2. 缺乏持续、统一的心智Persistent Mind与目标人类的幽默感是连贯自我的一部分。我们的笑点会随着经历、情绪、当下关注点而变化。但当前的AI模型每次对话尤其是在标准API调用下都是一个“全新的大脑”。它没有持久的记忆、持续的目标、稳定的“个性”或“情绪状态”。它无法像人类一样因为早上遇到一件趣事而一整天看什么都觉得好笑。这意味着AI无法形成持续的、个性化的幽默偏好。它无法告诉你“我更喜欢冷幽默还是热幽默”因为它没有“我”。这也使得“AGI觉得人类笑话不好笑”这个场景在当前的架构下无从谈起——因为没有那个持续存在的、会形成自己品味的“主体”。3. 从调侃到实践开发者如何与当下的“准AGI”共舞既然真正的、拥有类人幽默感的AGI尚在远方我们作为一线的开发者、产品经理或技术爱好者现在该如何行动关键在于调整预期找准定位分层利用。3.1 重新定义“智能”从“替代人类”到“增强人类”不要期待AI成为一个有独立幽默感、能完全理解你所有弦外之音的“伙伴”。而是把它看作一个能力超强的“语义增强处理器”和“创意激发器”。在创意工作中你可以用它来批量生成笑话草稿、段子开头、反转思路然后由你来筛选、打磨、注入真正的“灵魂”即基于你个人经验和情感的理解。它的价值在于打破你的思维定式提供你意想不到的关联组合。在内容分析中用它快速扫描海量内容如社交媒体评论、影视剧台词识别出其中可能包含幽默、反讽、玩梗的片段并进行初步分类如谐音梗、情景喜剧、语言歧义等极大减轻人工筛选的负担。但它做出的“是否好笑”的判断只能作为参考不能作为最终标准。在人机交互中为你的聊天机器人或虚拟角色注入一些可控的、模式化的幽默元素。例如当识别到用户话语可能带有玩笑性质时从预设的、符合角色设定的幽默回应库中选择一条。这创造的是“有幽默感的交互设计”而不是“有幽默感的AI”。3.2 构建可用的系统承认局限设计缓冲在设计任何依赖AI理解复杂语义包括幽默的系统时必须将“AI可能误解”作为第一原则来设计架构。永远提供人工复核与修正通道无论是AI生成的幽默文案还是AI对用户幽默意图的识别关键环节必须允许人工介入、否决或修改。把AI放在“助理”位而非“裁判”位。设计置信度与备选方案AI在输出时应尽可能给出它对自身判断的“置信度”例如这是一个谐音梗的置信度为85%。当置信度低于某个阈值时系统应自动触发备选方案如转为中性回应、直接询问用户意图或提交人工处理。建立反馈闭环让用户的修正和选择成为训练数据的一部分在符合隐私和政策的前提下持续优化模型在你特定场景下的表现。幽默有很强的领域性游戏社区的梗和财经新闻的梗截然不同。3.3 关注下一代架构世界模型与自主智能体虽然当前主流是LLM但眼光可以放长远关注那些试图解决根本局限的研究方向。这正是杨立昆等科学家努力的方向世界模型World Model研究如何让AI通过观察或交互学习物理世界和社会世界的基本规律形成可预测、可推理的内部模型。这将是实现真正“理解”的基础。自主智能体Agent赋予AI持续的目标、记忆和规划能力让它能在较长时间跨度内为完成一个目标而行动。这可能是实现“持续心智”的路径之一。具身智能Embodied AI让AI拥有“身体”可以是机器人也可以是虚拟环境中的化身通过与物理或模拟环境的交互来学习。很多幽默源于身体互动这可能是突破多模态理解瓶颈的关键。作为开发者即使不直接从事这些前沿研究了解其进展也能帮助你更好地判断技术趋势避免将短期资源过度投入到基于当前架构的、不切实际的功能幻想上。4. 最后的思考AGI的幽默感或许是我们的一面镜子回到最初的问题。我们为什么如此关心AGI有没有幽默感或许是因为幽默是人类智慧中非常珍贵且脆弱的一部分。它关乎共情、关于对荒诞的洞察、关于在压力下的释放。我们渴望被理解甚至渴望被一个更高级的智能“欣赏”我们的幽默。杨立昆的调侃像一句温柔的提醒在我们急切地赋予AI人性之时也许应该先更深刻地理解自己的人性。AGI的研发过程本质上也是人类不断厘清“智能”为何物、“意识”如何产生、“理解”怎样定义的过程。当我们有一天真的创造出一个拥有独特幽默感的AGI时我们面对的将不仅仅是一个工具而是一个全新的、需要我们去理解和共情的“他者”。在那一天到来之前脚踏实地或许是最好的态度。用好当前多模态AI在模式识别、信息整合和创意激发上的强大能力在它擅长的领域创造价值。同时清醒地认识到它在理解深层意义、拥有主观体验方面的局限用系统设计来弥补而不是用美好的想象来掩盖。技术的进步终将来自这份既充满热情又保持冷静的务实。而关于幽默的终极答案也许就藏在我们与AI共同进化的漫长旅程中。