
做 arXiv 的 cs.CV 板块每日论文汇总这件事我从很早之前就开始断断续续地做中间换过好几版模板也踩过不少坑。今天这份是 2026 年 10 月 2 日的汇总标题写的是“汇总-2026.10.02-计算机视觉论文”其实就是把当天新挂出来的计算机视觉方向论文做一次过滤、分类和点评方便没时间刷 arXiv 的人快速知道今天有哪些值得看的工作。这篇文章我不打算只贴一份论文清单而是把这份汇总背后的筛选逻辑、分类思路、使用方法和避坑经验都摊开讲清楚。不管你是刚入门的同学还是已经在实验室里被 deadline 追着跑的同行只要你有“每天看点新论文”的需求这篇应该都能给你一些能直接用的东西。先说明一下这份汇总是什么它聚焦的是 arXiv 的 cs.CV 分类下当天新增的论文目标不是收录全部而是挑选出“有信息量”的那一部分。所谓有信息量可能是方法上有新东西可能是某个数据集或 benchmark 的更新也可能是某个任务被重新定义。每天这个板块的更新量都不小真正值得点进去看全文的大概只占一两成。所以汇总的价值不是替代你读论文而是帮你把筛选这步先做了。1. 在开始之前arXiv cs.CV 这个板块到底在发生什么1.1 每日更新的体量与噪声先聊一个很多人没概念的事实cs.CV 现在每天的论文增量动辄一两百篇遇到会议截稿前的冲刺期数量还能再往上翻。这个数字意味着什么如果你真的每天把标题和摘要全部过一遍按一篇 30 秒算也需要一个多小时而且这个时间只够你“看过”根本谈不上“消化”。更麻烦的是其中相当一部分是同一思路的微小变体或者实验还没做完就先把 idea 占坑的工作信息密度很低。所以我做汇总的第一件事其实是做减法。先把明显不相关的方向滤掉比如纯图像处理老调重弹、某些只换了数据集没有新方法的增量工作再把剩下的一篇篇看摘要。这个过程很像编辑审稿不是看到标题就收而是要判断“这篇东西对目标读者有没有增量”。我自己的经验是噪声主要来自三类一是标题起得很唬人但内容是已有方法的拼凑二是把一个小 trick 包装成重大突破三是只放了摘要没有正文、代码和数据的“占位型”提交。这三类在汇总里我基本都不会给太高权重最多在“值得关注”里提一句存在。1.2 一张汇总表应该包含哪些信息一份能让人看下去的论文汇总信息粒度很重要。我试过好几个版本最后固定下来每篇论文给四样东西标题、所属方向、一句话概括、推荐理由。标题给原题方便检索方向决定它被归类到哪个板块一句话概括帮读者在五秒内判断要不要点开推荐理由则写清楚它到底新在哪里是和谁比的还是开创了一个新任务。这里有个容易犯的错把摘要原封不动地翻译一遍。摘要本来就是作者自己写的广告里面充满了“sota”“首次”“显著提升”这类词直接搬过来没有任何增量。我做汇总时一句话概括必须自己写讲清楚这篇工作的核心操作是什么。比如“这篇提出用某类特征做跨帧匹配在遮挡场景下比之前的方法稳”而不是“本文提出了一种新颖的方法取得了优秀的性能”。板块划分方面我目前用的是检测分割、图像生成与编辑、多模态与视觉语言模型、三维视觉、视频理解、低层视觉与复原、高效模型与部署外加一个“其他”。分得太细会割裂分得太粗又找不到东西这个粒度是折中后的结果。2. 我筛选论文的三个层次从标题到精读2.1 第一层标题里的信号词标题是论文的第一道过滤器但它不能只看关键词要看关键词的组合方式。我的做法是先在标题里找“动作词”提出了、证明了、发布了、统一了、重新思考了。这些词说明这篇论文确实做了某件事而不是单纯报了个实验。比如标题里出现“重新思考”rethinking或者“再探”revisited通常是作者对某个经典问题提出新的理解这类论文往往附带实验分析比堆砌新模块的论文更有营养。出现“统一框架”unified framework则意味着作者试图把多个任务合并到一个模型里这个方向在视觉基础模型时代非常主流但也最容易出现“统一了半天性能全掉”的情况需要谨慎。反过来如果标题里只有“基于 XX 的增强”这种结构内容大概率是在已有成果上做小改进。不是说这种论文不值得看而是它们在汇总里的优先级应该靠后。我把标题筛选当成漏斗的第一层目标是十分钟内把一两百篇缩到三四十篇。2.2 第二层摘要的结构化阅读到了三四十篇这个量级逐篇读摘要就是必须的了。摘要我习惯按四段式来拆问题背景、已有方法的不足、这个工作的做法、实验结论。大多数摘要都会覆盖这四块信息只是顺序和篇幅不定。我关心的是第三块和第四块尤其是“做法”到底细到什么程度。如果摘要里写的是“我们提出了一个端到端的框架包含编码器、注意力模块和损失函数”这就是废话没有任何信息量。合格的写法应该类似“我们用双分支结构分别处理全局与局部特征在推理时将两路输出做自适应融合”这种描述能让我判断这个方法是否跟手头的工作有交集值不值得花十分钟看全文。另外一个容易被忽略的点是摘要里“对比对象”和“实验范围”的措辞。只跟两三年前的基线比那是挑软柿子捏能在当前主流的几个方法上做全面对比说明作者有底气。我筛选时会把“对比充分”作为加分项因为这类论文的结论更可靠拿来当参考基准也更放心。2.3 第三层图表与开源信息的交叉验证摘要过得差不多了会剩下一批“值得点开全文”的论文。真正打开 PDF 之前我通常会先做的事是查它有没有开源代码以及从摘要附带的图表里判断结果可信度。先说开源。虽然开源不等于高质量但一个论文如果有完整的训练代码和模型权重至少说明作者愿意接受检验我复现或者基于它做二次开发的门槛也低。反过来摘要吹得天花乱坠却连一个链接都不给的论文在汇总里我会标注“仅方法介绍”提醒读者不要轻易投信任票。图表这边我重点关注两个地方一是方法示意图的结构是否复杂到不可理喻二是消融实验是否覆盖了关键模块。一张只有四个框的示意图通常意味着方法很简洁这在现在的视觉论文里反而稀缺而一张没有消融的表格哪怕指标刷得再高说服力也要打折扣。交叉验证这一步做完最终能进到“深读”名单的一般就剩五到十篇了。3. 2026年10月初这批论文的几个主线方向3.1 视觉基础模型与统一框架先说当天汇总里分量最重的一条线视觉基础模型。这两年这个方向的趋势非常明显大家不再满足于一个模型只解决一个任务而是试图用一套骨干网络、一套训练范式去覆盖检测、分割、关键点估计甚至图像编辑。当天这类论文出现了好几篇其中一篇的做法比较典型把多个任务的输出头统一成一个可插拔的接口用共享的视觉编码器加任务特定的轻量头在训练时通过任务均衡策略避免不同任务之间的冲突。这类工作的价值在于它的“杠杆效应”。一旦基础模型做好下游任务的开发成本会大幅降低很多垂直场景只需要微调少量参数就能上。但我也看到一些实际问题统一模型的参数量和推理延迟通常不低真正要落地到端侧还得配合蒸馏和量化。所以汇总里我专门给它加了一句“性能与效率的权衡是主要瓶颈”。另一个值得关注的点是“测试时训练”概念的回归。有几篇论文在做推理阶段的动态适应让模型在测试样本上临时调整自身参数。这个思路不是新的但在基础模型时代重新变成热点原因在于基础模型足够大推理时只调整少量模块就能带来明显增益。3.2 可控生成与图像编辑图像生成这条线依然是当天数量最多的板块之一。趋势上大家的关注点已经从“怎么生成一张好看的图”转向“怎么精确控制生成结果”。什么是一张图里的身份属性、结构布局、风格信息要能把它们分开控制才能谈得上可控编辑。当天有一篇论文专门做了这种解耦它把内容表征和外观表征分到两个不同的特征空间编辑时只动其中一个另一个保持不变从而做到“改风格不改内容改布局不改主体”。这个方向在实际应用中需求很刚电商场景里的商品换背景、设计场景里的局部改稿、内容创作里的风格迁移本质上都是可控生成问题。对做应用的团队来说这类论文的实战价值比单纯的文生图刷新指标要高。不过我得给各位提个醒可控生成方向的论文实验部分的主观性很强同一个指标在不同方法下的定义都可能不一样比如“编辑一致性”到底是用 CLIP 相似度算还是用分割掩码对齐算差别很大。看这类论文时别只盯着分数要看到具体指标背后的测量方式。3.3 三维重建与空间智能三维视觉这批也有好几篇值得说。随着具身智能和空间计算的概念持续升温从单目图像重建稠密三维结构的工作越来越多。当天有篇论文属于这一类的典型代表输入一段普通视频输出带纹理的网格模型关键点在于它对动态场景做了处理不是只重建静态背景。这类工作的难点我拆开讲一下单目输入本身存在尺度模糊纯靠网络去猜尺度会有系统性误差视频里如果有运动物体重建算法会把物体和背景耦合在一起导致边缘糊掉。这篇论文的解决思路是同时估计深度和运动场再把两者融合到同一个隐式表征里从结果上看在处理人的走动、相机跟随这类场景时比前作稳定不少。三维重建还有一个长期存在的工程问题离线重建做得再好一到手机端就慢得没法用。所以我在汇总里特别标出那些在论文里报告了实际运行时间的工作而不是只看重建精度。真正能走向产品的三维重建必须在精度和速度之间找到平衡点纯精度导向的论文离落地还有距离。3.4 小目标检测与长尾分布检测方向当天最扎眼的是两篇处理长尾问题的论文。长尾是什么简单说就是训练数据里某些类别数量特别多某些类别少得可怜模型学出来之后对头部类别过度自信对尾部类别几乎认不出。这在实际场景里非常常见工业质检的缺陷种类、自动驾驶的罕见障碍物、遥感图像里的小目标全是长尾分布。其中一篇的做法是对采样策略动手它不是简单地按频率加权而是根据模型在验证集上的各类别误差动态调整每个类别的采样概率。想法很直接但实现细节里有不少讲究比如误差怎么平滑估计、调整的步长怎么定稍不小心就会导致训练不稳定。另一篇则走了结构路线在分类头里给尾部类别单独分配一组参数减少头部类别的梯度干扰。这两篇我都放在“值得一看”里理由是它们的思路都不依赖大规模额外数据对算力有限的实验室比较友好。现在很多论文动不动就用几十亿数据预训练方案好是好但普通团队根本复现不动。相比之下在采样策略和损失函数上做文章的工作迁移成本要低得多。3.5 高效推理与端侧部署最后一条主线是效率优化。视觉模型越做越大但工业界的 GPU 资源是有限的手机和嵌入式设备上的推理需求更是刚性的。当天的汇总里有几篇论文在做这件事有的做结构剪枝有的做量化感知训练有的在裁剪 token 数。其中一篇的思路我觉得挺有启发性它分析了模型在推理时每个层对最终结果的贡献度发现不少层的贡献是冗余的于是设计了一个插桩式的按需计算机制让简单样本走浅层提前出结果复杂样本才走完整网络。这种动态推理的思路在 NLP 那边已经比较成熟了但在视觉任务里还会引起额外的不确定性因为图像的难度没法像文本那样轻易判定。这篇论文的贡献在于它把难度判定也做成了一个可学习的模块而不是用简单的统计量去猜。效率类论文的汇总我有自己的偏好优先看那些同时报告了“精度变化”和“实际加速比”的工作。很多论文只给理论计算量减少多少倍不提实际推理时间因为实际操作中的内存拷贝、算子调度会吃掉不少理论收益。实际测出来的加速比才是判断这篇值不值得跟进的硬指标。4. 从汇总到自己的知识库我的笔记与复现流程4.1 三类笔记速览、深读、复现汇总推出去之后我常被问一个问题每天看了那么多论文怎么记得住我的答案很简单——记不住所以要做笔记。但笔记也分层我把它分成三类。第一类是速览笔记专门记那些“知道有这么个方向存在就够”的论文。这类笔记一行字搞定方向、方法名、一句核心思想、跟进理由。它解决的是未来查资料时的盲区不至于遇到问题时想不起有人做过类似工作。第二类是深读笔记给那些通过层层筛选、我准备认真读的论文。这类笔记我会写结构化的内容问题定义、动机、方法与之前方案的本质区别、实验的局限、我能借鉴的点。第三类是复现笔记只针对我计划跑代码的论文内容包括环境配置、训练资源需求、数据准备要点、踩坑记录。这三类笔记的文件组织我也说说。我的习惯是按照年份和方向建目录比如“2026/三维重建/”。每篇论文一个 markdown 文件文件名里包含短标题和年份方便检索。这样坚持下来半年之后你手上就会有一个按主题组织的私有知识库比任何第三方的论文阅读工具都顺手。4.2 复现优先级如何排每天值得复现的论文不超过两三篇所以必须想清楚优先级。我自己排序的依据有三个第一是相关性它跟手头的项目关系越直接优先级越高第二是资源门槛我手里的卡能不能跑得动数据好不好搞这两个条件卡掉一半论文第三是增量如果它只是在某个已有模型上换了损失函数那我复现的意义就不大但如果它引入了新的训练范式或新的网络结构哪怕相关度一般我也会为了拓展思路去读代码。复现之前还有个动作非常重要看这个仓库的活跃度和 issue 区的讨论。一个论文仓库如果 issues 里全是“训练 loss 不收敛”“复现指标差很远”说明它的开源质量有问题很可能论文里有一些没写清的细节。反过来如果 maintainer 积极回复问题还有别人贴出成功复现的经验帖那么这篇论文的可靠性就高很多。我自己的记录习惯是复现笔记里的环境依赖必须写死版本号。很多“论文复现不出来”的案例最后查到根因都是环境版本对不上查错效率极低。版本锁死之后换个机器也能一把跑起来。4.3 阅读顺序建议面对一份汇总正确的打开顺序是什么我建议先看你最熟悉的方向那里你最能判断出论文的含金量然后看相邻方向可能给你手头的工作带来交叉灵感最后再瞄一眼完全陌生的板块不深读只建立印象。这里有个常见的误区有人觉得论文要从最好的看到最次的其实应该反过来。在同一个方向里先看综述性的工作建立坐标系再看具体方法最后看那些被引用为 baselines 的工作。顺序反了的话很容易被最新论文的措辞带着走失去判断基准。我现在每份汇总结尾都会附一句“阅读优先级”就是为了帮读者调整顺序。5. 自动化与工具链半小时完成一份汇总5.1 抓取与过滤很多朋友以为整理一份汇总要花一整天其实熟练之后每天固定花在抓取和过滤上的时间可以控制在半小时以内前提是要有工具链。最基础的一步是抓取。arXiv 提供了官方接口可以通过关键词或者分类号直接拉取当天的论文元数据包括标题、摘要、作者、链接。我写了一个简单脚本定时跑把结果存成 JSON。过滤这一步我一开始用纯规则比如标题里包含某些词就拿出来包含某些数据集名就优先。后来发现规则写多了也麻烦干脆改成两段式脚本先按规则粗筛把明显不相关的滤掉剩下的由人工逐篇判断。完全自动化暂时替代不了人因为筛选论文这件事本身需要领域知识但自动化的价值在于把机械劳动干掉让你把精力留给最值钱的判断环节。代码层面没什么高深的无非是用 requests 请求接口、解析字段、按时间排序。如果会一点 Python照着文档写个几十行足够。5.2 分类与去重抓下来的论文需要去重这里说的去重不只是重复提交还包括同一个工作在不同时间点的不同版本。作者挂出来之后过几天可能更新一版摘要几乎没变这类不该占汇总的篇幅。我处理的方式是记录每天看到的标题集合哈希一下遇到重复的就跳过。分类我目前是半自动的。关键词分类能覆盖一部分比如标题里带 segmentation 的就归到分割带 diffusion 的就归到生成但总有一些论文用词很新颖规则匹配不上。这些就靠人工归。我还维护了一份高频词汇表每季度更新一次把新增的方向词和相关词加进去保证分类规则跟得上研究风向。5.3 生成摘要的注意事项到了写摘要这一步也是整份汇总最体现功力的地方。我的原则是宁可少写不要乱写。每篇的推荐理由都尽量指明“这篇的贡献点在哪个环节”如果实在看不出来就老老实实写“方法 novelty 有限但实验资源丰富提供了 X 场景下的 baseline”。生成摘要的时候还有两件事要特别注意。第一是尊重作者的意图不要在没有细读全文的情况下对他人的工作做负面评价汇总里我只写“这篇的取舍是什么”不写“这里做得不好”。第二是不要为了显得有信息量而编造细节比如不确定有没有开源就写“未确认开源”而不是默认它有。6. 常见问题与避坑记录6.1 被标题骗过之后做汇总这几年我被标题骗的次数不少。最典型的一次是某篇标题写着“首个零样本通用分割模型”点进去发现它只是把已有模型的 prompt 换了个输入形式然后在几个小数据集上测了测跟标题的“通用”关系不大。这件事给我的教训是标题是论文最不可信的部分之一因为它承担的是传播功能不是信息功能。从那以后我筛选时养成了一个习惯凡是标题里出现“首个”“最强”“新范式”这些词我都会自动提高警惕先看摘要里有没有对应的硬证据比如新数据集、新的评测协议、可复现的代码。没有这些支撑的形容词权重直接降一档。6.2 摘要乐观偏差摘要里的性能数字常常有“乐观偏差”这倒不是说作者造假而是在学术写作的惯例里大家默认报告自己最好的设置。随机种子引起的波动、评测集上的偶然优势、超参反复调试后的过拟合这些都不会写在摘要里。我处理这个问题的办法是只看趋势不抠绝对数字。同一篇论文在不同数据集上的相对提升幅度比它在单个数据集上的绝对数值更有意义。另外遇到关键指标突然涨了好几个点时我会去正文里找评测协议的描述看是不是换了数据划分或者评估口径。这不代表不信任而是对时间和精力负责。6.3 信息过载的应对总有人问每天这么多论文看得完吗答案确实看不完也不需要看完。这个问题的本质是信息过载解决它的关键不是提高阅读速度而是降低阅读目标。我把看论文的目标定为保持对研究趋势的感知不错过跟自己工作直接相关的进展。除此之外的论文看到标题就够了不需要有负罪感。每个月我还会做一次“清理”把那些当时觉得重要但后来再没打开过的论文从待读列表里清掉。待读列表过长本身就是一种负担与其囤积不如承认自己的精力有限。真正重要的论文不会被时间冲走如果过了两周还在被反复引用那时候再读也不迟。6.4 自己要不要发这类汇总最后聊一个很多人私下问我的问题整理论文汇总这件事对个人成长有没有用我的看法很直接有用但不是因为“做了份公开资料”而是因为筛选的过程逼迫你建立判断标准。你每天都要回答“什么值得关注、什么不值得”三个月下来你对一个领域的直觉会比不筛选的人敏锐很多。但发不发公开汇总要慎重。一方面汇总一旦发出去就有读者依赖它断更会有压力另一方面公开点评别人工作容易引来不必要的争论尤其在没细读全文的情况下。我个人现在的做法是完整版笔记只自己留着对外只发一个精简版列方向和标题不写任何评价性的话。这样既不辜负自己记录的初衷也少了很多麻烦。我自己这些年整理汇总的最大体会是这件事表面上是体力活实际上是在训练“品鉴”能力。论文读得多不等于读得好一针见血地指出一篇工作的贡献点在哪里、局限在哪里才是真正值钱的本事。如果你也想尝试我建议从自己的研究子领域开始每天只整理一小类坚持一个月你会明显感觉到自己看论文的视角变了。