
上周我把刚改完的答辩 PPT 转成 PDF丢进 Workbuddy 里本意是让 AI 当个免费评委帮我看看还有什么硬伤。结果它通读一遍之后第一句话让我有点没绷住整体结构还行但第三章的每一个结论我都没找到支撑数据。请问这些数字是从哪来的然后它就开始追着我要证据——图表的来源、引用的年份、实验的硬件配置、对比实验的超参数一条接一条比我导师还较真。这套组合拳打下来我反而收获很大。材料里确实有太多地方是我觉得没问题但实际上经不起追问的。整个过程用到了两个工具TextIn 的 xParse 负责把答辩材料从 PDF 变成大模型真正能读懂的 Markdown 文本Workbuddy 负责把多个 AI 角色组织起来做协同审阅。这篇文章我就把这个实践完整拆开讲包括解析环节的坑、Agent 角色怎么配、AI 是怎么一步步追问到证据的以及最后我沉淀出来的那套证据链检查方法。如果你也是准备答辩的研究生、要交项目结题报告的工程师或者想给论文做预审的科研党这套流程可以直接抄作业。1. 答辩材料的电子化xParse 解决了大模型读 PDF 的什么痛点1.1 直接喂 PDF 给大模型问题出在哪儿很多人第一步就栽了把 PDF 直接丢给大模型让它读。如果材料是纯文字排版的 Word 转 PDF运气好还能读个七七八八但答辩材料几乎都是 PPT 转出来的 PDF版面极其复杂——两栏排版、图文混排、跨页表格、公式、页眉页脚这些东西在 PDF 的底层文本流里是乱序的。大模型拿到手之后读到的文字可能是第 3 章 实验结果……方法对比……图 4 性能比较……结论……前后文逻辑全断你指望它审出什么问题基本不可能。更麻烦的是另一种情况答辩 PPT 里的文字是图片形式或者是从别的软件截图贴进来的。这种 PDF 连文本层都没有大模型根本读不到任何内容。我见过最夸张的一份材料整页 PPT 都是截图PDF 文本提取出来是空的。1.2 xParse 的解析逻辑先看版面再读文字TextIn 的 xParse 解决的就是这个版面感知问题。它做的事情可以理解成先像人一样扫一遍页面搞清楚哪些区域是标题、正文、表格、图片、页眉页脚然后在脑子里还原出阅读顺序再按照这个顺序把内容输出成 Markdown。具体拆开看核心能力有这么几块版面分析识别页面上每个区域的功能类型把正文和装饰元素分开。阅读顺序还原按人眼的阅读习惯重排内容顺序而不是照搬 PDF 底层文本流。OCR对扫描版、图片型文字做识别包括中英文混排。公式识别把数学公式转成 LaTeX 符号方便大模型理解。表格还原把复杂表格转成 Markdown 表格结构保留合并单元格和跨页关系。对于答辩材料来说最值钱的是版面分析和阅读顺序还原这两项。你想想评委看 PPT 的时候是不是先看标题、再看正文、再看图表xParse 输出的 Markdown 就是这个顺序大模型按照这个顺序读和评委看材料的逻辑是一致的审出来的问题才靠谱。1.3 实际解析效果和我踩过的坑我用 xParse 解析了一份 42 页的答辩 PPT 转 PDF整体效果相当不错。文字部分基本无损表格转成了规范的 Markdown 表格公式也还原成了 LaTeX。但有几个坑必须提醒你第一长文档的接口限制。xParse 的单次请求有文件大小上限页数特别多的大文件会被拒。我实际的做法是先把 PDF 压缩或者按章节拆成几个文件分别解析最后再拼接 Markdown。拼接的时候注意标题编号别错乱。第二公式特别多的页面需要人工校对。绝大多数公式识别是准的但偶尔会有上下标偏差。答辩材料里的公式一般不算太复杂问题不大但如果是论文级别的重公式建议解析完扫一遍。第三跨页表格有细微的合并逻辑问题。xParse 会尽力把跨页表格融合成一个整体但如果源表格里有复杂的合并单元格Markdown 呈现出来可能会用额外的缩进符号表示读起来有点别扭但不影响大模型理解内容。我用的调用方式大致是下面这样具体接口地址和鉴权方式需要在 TextIn 控制台里确认最新版本import requests url https://api.textin.com/ai/service/v1/pdf_to_markdown headers { x-ti-app-id: 你的AppID, x-ti-secret-code: 你的SecretCode } with open(答辩材料.pdf, rb) as f: response requests.post(url, headersheaders, files{file: f}) result response.json() markdown_content result[result][markdown] with open(答辩材料.md, w, encodingutf-8) as f: f.write(markdown_content)解析完拿到 Markdown 文件之后先自己快速通读一遍确认内容完整、顺序正确再进入下一步。这一步花 10 分钟能避免后面 AI 因为读错材料给出完全跑偏的审阅意见。2. 在 Workbuddy 里搭审阅班子单模型审阅为什么会漏2.1 单次对话审阅的三大局限拿到解析后的 Markdown最直接的想法是复制给大模型问一句帮我审一下这份答辩材料。实测下来这种单模型、单轮对话的审阅方式有三个致命问题。第一上下文装不下。答辩材料动辄几千行 Markdown一次性塞进对话窗口前面的内容就会被截断模型只看了前半部分就开始给意见后半部分完全没读到。分多次问也不行它会忘了前面说了什么前后意见自相矛盾。第二标准会漂移。同一份材料上午问和下午问模型给出的审阅标准可能完全不一样。上午它觉得背景介绍可以再精简下午它可能就觉得背景介绍要保留完整。没有一套固定的检查清单AI 的发挥就纯看缘分。第三角色混乱。你既希望它做结构审查又希望它做证据核查还希望它给修改建议结果它是全能的也是全不能的——每个任务都做了但每个任务都做不深。特别是证据核查这种需要较真的活儿混在通读任务里很容易被一带而过。2.2 多 Agent 协作让每个角色只干一件事Workbuddy 这类 AI Agent 工作台的核心思路就是把一个复杂任务拆成多个角色让每个 AI 只负责一个维度然后把它们的输出汇总起来。我在这个答辩审阅场景里设计了四个角色审阅者通读全文输出结构诊断和内容层面的问题比如章节比例失衡、逻辑断层、表述模糊。证据核查员这是最关键的角色逐条检查结论-证据的对应关系找出所有没有支撑的论断。质疑者模拟评委视角故意找茬专门追问那些答辩现场最容易被挑战的问题。汇总人把前三者的意见合并同类项去重、分级、排序最后产出一份带优先级的修改清单。实际配置的时候我在 Workbuddy 里建了多个 Agent 会话让它们以流水线方式工作审阅者先跑输出结果喂给证据核查员证据核查员再跑输出结果和质疑者的结果一起喂给汇总人。每一个环节只用专注自己的任务深度完全不同。2.3 用 Skill 固化审查标准如果只是临时问一次那用对话就行。但如果你打算每次答辩材料都用这套流程或者想分享给课题组同学那就必须把审查标准固化成 Skill——说白了就是一组可复用的提示词模板。我以证据核查员为例Skill 的核心提示词大概是这样的## 你的任务 你是证据核查员。你的唯一任务找出材料中所有结论-证据不对应的地方。 ## 证据类型 - 数据类证据结论引用的数字是否有来源、采集时间、样本量、统计方法 - 文献类证据引用的文献是否存在于文末参考文献列表引用内容是否准确对应 - 实验类证据实验环境、超参数、运行次数、随机种子是否说明 - 逻辑类证据结论能否由前提推导出来对比是否公平 ## 输出格式 按表格输出问题位置 | 原文摘录 | 缺失证据类型 | 建议补充内容 ## 禁止行为 - 禁止自行编造证据或猜测具体数值 - 禁止给出与证据无关的泛泛建议把这个 Skill 配置到 Workbuddy 里之后每次审阅都会按照同一套标准执行不会再出现上午和下午标准不一致的问题。团队成员之间也可以直接分享这份 Skill 配置毕竟一套稳定的审阅标准比单次审阅得到一堆零散意见要值钱得多。3. 把答辩材料丢给 AI它追着我要证据的全过程3.1 材料准备与角色部署这次实践我用的是一份 42 页的答辩 PPT主题是某算法在特定场景下的优化研究。准备工作分三步先用 xParse 把 PDF 解析成 Markdown然后按章节拆成几个部分方便分段处理最后在 Workbuddy 里按上面的角色配置建好四个 Agent。这里有个细节值得多说一句Markdown 分段处理不是说让每个 Agent 各看一段就完事而是让同一个 Agent 分批次读完全文。比如审阅者先读 1-14 章再读 15-42 章最后基于完整记忆输出意见。Workbuddy 的会话上下文能把这两轮的阅读记忆串起来这点比单次对话硬塞要好得多。3.2 第一轮结构诊断结果在意料之中审阅者的第一轮输出还算常规但它给了几个我之前真没注意到的点第 1 章背景部分占了 9 页技术方案只有 8 页比例失衡。评委核心关注点应该是你的方法背景部分比重过大。第 7 页出现我们前期工作中发现但没有引文指向任何前期工作。图 3 的标题是性能对比但图注里没有给出横纵轴的单位物理意义不明确。这些属于结构层和表述层的问题自己看多了容易麻木换个角度果然能发现盲区。3.3 第二轮AI 开始追着要证据真正让我破防的是证据核查员的第二轮输出。它逐条输出了一个表格每一行都是问题位置 | 原文摘录 | 缺失证据类型 | 建议原话大致是这样的绪论里写目前最优的方法 F1 达到 91.2%请问这个数字来自哪篇论文论文标题和年份是什么图 3 的对比实验没有提到 batch size 和学习率。这两个超参数直接影响结果可比性请补充。表 2 最后一列运行时间只测了一次。单次结果受系统负载和随机性影响很大建议补多次运行的平均值和标准差。参考文献 [7] 是 2019 年的论文你用它来对比 2024 年的工作时间跨度比较大请解释选它的理由。部署成本降低 30%这个数字是怎么算出来的没看到测算过程。它逐条指出了我每个论断缺的东西。这就是追着我要证据的完整画面不是泛泛地说这里不够严谨而是精确到页码、精确到缺失的证据类型、精确到需要补什么内容。3.4 面对追问我做了什么AI 追着要证据我不能只是被动挨打得逐条处理。我把它的输出当成了检查清单分了三类处理第一类确实是我漏了的比如 batch size 和学习率没写、运行时间只测了一次、图 3 缺单位说明。这些我老老实实补上该加参数表加参数表该补统计量补统计量。第二类是表述过于绝对的比如显著优于这种说法在没有做显著性检验的时候本来就不该用。我把这类表述改成了在本文实验配置下优于既不夸大也不心虚。第三类是没法补的比如有些对比方法我们确实跑不了只能引用原文数据。我就在材料里如实写了本方法未复现该方法对比数据来自原文把口径说清楚让评委知道这是引用而不是我们实际测的。这里必须提醒一句AI 的意见不是全对。证据核查员曾经把没有写软硬件环境配置标成了严重问题但实际上我的答辩口头陈述会提这一句PPT 正文省略了而已。所以 AI 输出之后人工复核这一关绝对不能省。4. 让 AI 追着证据跑规则设计与防幻觉4.1 把证据定义清楚AI 才知道要什么实践下来我发现AI 追着要证据这件事质量高低完全取决于你怎么定义证据。定义模糊它就会泛泛而问定义清晰它就能精确打击。我把答辩材料里的证据分成了四类每类对应一组检查点证据类型检查点示例追问数据类证据来源、采集时间、样本量、统计方法、单位这个 91.2% 是哪篇论文的结果文献类证据参考文献是否存在、引用内容是否对应、年份是否合理引这篇 2019 年的文献说明 2024 年的 SOTA 合理吗实验类证据硬件环境、软件版本、超参数、运行次数、随机种子batch size 是多少跑了几次逻辑类证据前提-结论推导链、控制变量、对比公平性部署成本 30% 是怎么测算的把这套分类写进 Skill 之后证据核查员的追问质量肉眼可见地提升了一个档次。它不再是这里好像有问题的模糊质疑而是这里缺的是什么类型的证据、按什么标准检查的精准提问。4.2 防幻觉AI 很容易顺手编证据这是整个实践里最大的坑必须单独讲。AI 在发现某处缺证据之后经常忍不住自己编一个合理的证据补上。我遇到过它写建议补充实验在 RTX 3090 上完成batch size 为 32——这俩数字完全是它猜的我原文里一个字都没提。防幻觉的规则要在 Skill 层面写死。我在证据核查员的提示词里加了两条硬性规则只指出缺失不提供具体数值。任何建议补充的内容如果必须写示例数字必须用例如开头并标注此数值仅为占位示例需人工填写。输出质疑时必须引用原文摘录。凡是拿不出原文摘录的质疑视为无效不进入最终清单。加了这两条之后AI 的输出就干净多了——它只负责指出哪里缺证据、缺什么类型的证据至于证据本身是什么留给我自己填。这从根本上杜绝了AI 审阅之后材料里多了一堆它编的数据这种事故。4.3 AI 也会误报人工复核与分级处理就算规则定得再好AI 还是会有误报。我梳理了这次实践中遇到的几类典型误报答辩内容属于口头信息有些信息答辩者会口头说但 PPT 正文没写。AI 不知道这个前提就会把这类信息标为缺证据。示意图被当成实验图有些图是流程示意不是实验数据图。AI 会误判图没有给出数据来源但这种图本来就不需要数据来源。经典文献按年份误判有些引用是领域内的奠基性文献年代久远但引用完全合理。AI 只看年份就会问为什么引这么老的文献。所以我把 AI 的输出分成三档处理严重问题必须改、建议核实可能改、仅供参考不用改。在实际跑完一轮之后大约有 20% 的质疑被我降级处理了。这个比例不高但足够说明人工复核的必要性。另外还要设置迭代轮次的退出条件。AI 一旦开始追证据很容易无限循环——你补了一个证据它又追问这个证据本身的证据没完没了。我的做法是最多跑两轮第二轮只放大第一轮标记过的问题其他新问题一律不接。答辩材料审阅不是科研打假适可而止远比无穷无尽更有价值。5. 这套流程还能用在哪儿从答辩到项目汇报、论文投稿5.1 论文投稿前的 AI 预审答辩材料审完一遍之后我马上把同一套班子用在了准备投稿的论文上。效果同样出乎意料。论文的场景和答辩 PPT 不太一样它的版面更规整、信息密度更高xParse 解析出来的 Markdown 质量也更好。证据核查员在论文上能干的活儿更多检查摘要和结论是否一致。我见过不少论文摘要说提出了 A 方法结论里却变成提出了 A 方法和 B 方法这种不一致审稿人一抓一个准。检查图表自明性。图题是否完整、坐标轴单位是否标注、缩写在第一次出现时是否解释——这些都是 AI 擅长的机械性核查。检查引用完整性。正文引用了 32 篇文献文末参考文献列表是不是正好 32 条编号有没有错位AI 可以帮你逐条核对。5.2 项目结题报告的目标-指标-证据审查如果你在工程岗大概率会遇到项目结题报告的撰写。这类材料最常见的毛病是目标说了三大项指标罗列了五小项达标情况写了一大段但每一项指标的证据——测试报告、截图、数据记录——对不上号。这套流程完全可以直接搬过去。让证据核查员从指标倒推你宣称完成了哪几条指标正文里对应的证据在哪测试记录有没有日期截图有没有上下文数据有没有统计口径AI 追着要证据的逻辑放在结题报告里就是追着要测试记录本质上是同一件事。5.3 把流程沉淀成团队审查规范现在我已经把这套流程整理成了四步走直接写进团队的知识库第一步解析。任何要对外发的材料先用 xParse 转成 Markdown确保 AI 能读得懂版面。 第二步结构审阅。审阅者 Agent 通读全文输出结构诊断。 第三步证据核查。证据核查员 Agent 逐条追问输出缺证据清单。 第四步人工复核。花 20 分钟过一遍 AI 的质疑清单分级处理。四步可以拆开单用。有些场景不需要全套比如只是改个 PPT那直接跑结构和证据两步就够了。关键是这个小流程从最开始就强调证据这个词让写材料的人从源头上多想一步这句论断的证据是什么Workbuddy 里的 Skill 配置可以直接复制给同事配置文件也统一放在共享盘里。换一份新材料、换一个新人来操作只要按这个四步走跑一遍产出的审阅结果基本都在同一水平线上。这就是流程标准化带来的好处不依赖某个人多认真而依赖整套方法本来就是对的。我之前总觉得答辩材料被质疑是嘴笨的问题这次实践教会我的恰恰相反绝大多数被追问到哑口无言的情况根源不是临场反应慢而是材料本身真的缺东西。AI 追着我要证据的过程其实就是帮我把我觉得没问题翻译成这个结论的证据在哪然后一个个补上。我现在养成了习惯任何要对外发的材料先解析再丢给 Agent 审一遍最后自己花 20 分钟复核它的质疑清单。有一个细节值得反复强调AI 的追问要分级看待它的质疑本身也需要被质疑。遇到涉及细分领域判断的地方它给的只是线索最终决定权一定要在自己手里。工具能帮你把材料里的证据缺口标出来但哪些缺口真补、哪些改用措辞圆过去、哪些干脆承认真做不了这些判断还得你自己来。用 AI 审材料这件事把它当成一个极其较真、记忆力极好但不懂行的助手是最好用的状态。