2017-2024全国10米/20米水稻种植分布数据集:从物候特征到生产应用 做农业遥感这些年水稻识别一直是个又爱又恨的题目。爱是因为水稻的种植结构相对规整、物候特征鲜明一旦识别出来成果特别漂璃恨则在于中国的水稻种植区从东北到海南跨度太大插秧时间、生长周期、农田形态各不相同区域性模型换个地方就水土不服。大部分公开的作物分布产品不是分辨率太粗就是年份太老真正能用于县级尺度分析和多年变化评估的数据少之又少。所以当我看到这套 2017–2024 年中国 10米/20米分辨率水稻种植分布数据集时第一反应是终于有人把这件事系统性地做完了。它覆盖全国范围时间跨度为 8 个完整生长季空间分辨率做到了 10 米到 20 米这意味着一个小田块、甚至一条田埂两侧的种植差异都能在影像上看出来。不是那种大概知道哪里种了水稻的尺度而是可以落到地块、落到灌区、落到乡镇边界去分析的真实空间信息。这套数据适合谁用如果你在做粮食种植结构监测、农业补贴核查、稻田温室气体排放核算、或者作物生长模型的空间化输入它基本可以当作业界默认的底图级数据。我自己用它做过县级的稻虾共作面积提取也拿去做过省级尺度的早稻种植面积与统计数据的对比分析整体感受是精度够用细节丰富但如果说完全开箱即用、不需要任何后处理那也是不现实的。这篇文章就把我从数据下载到实际应用的全过程拆开讲透包括数据生产逻辑、使用注意事项、以及几个不建议踩的坑。1. 这套数据集解决的核心问题1.1 水稻遥感识别为什么一直很难很多人以为水稻识别和森林识别一样拿一景夏季影像训个分类器就能出结果。实际上不是这么回事。水稻的种植方式决定了它在光学影像上存在一段消失期——插秧前后田块灌水翻耕地表被水和泥土覆盖植被指数极低和空地、撂荒地几乎难以区分。到了分蘖盛期水稻长起来以后NDVI 快速升高又和玉米、大豆、高粱等旱地作物在光谱上高度相似。也就是说单一时相的影像要么把水稻漏掉要么把它和其他作物混在一起这是水稻遥感长期做不准的根本原因。另外一个难点是中国的水稻种植制度极度复杂。东北是单季稻长江中下游有早稻、中稻、晚稻的轮作华南还有再生稻再加上稻虾、稻鱼、稻蟹等综合种养模式水面和稻株混在一起光谱更乱。靠一个模型跑全国必然在某个区域翻车。所以真正好用的水稻分布产品必须解决两个问题一是时间维度上捕捉水稻特有的水—苗—穗变化过程二是空间维度上适应不同区域的物候差异。1.2 这套数据的产品定位这套 10米/20米分辨率数据集的定位很清晰做一张能反映真实逐年变化的全国水稻种植一张图。它和传统的 250 米分辨率产品比如 MODIS 衍生的作物分布图有本质区别。250 米像元对应的是 6.25 公顷一个像元里往往混合了水稻、沟渠、田埂、甚至房屋很难做地块级分析10 米像元对应 0.01 公顷一个标准稻田间基本可以容纳十几个像元边缘效应和混合像元问题被大幅压缩。从我拿到数据后的实际体验来看10 米和 20 米两套分辨率各有使用场景。10 米数据适合做南方丘陵地区的破碎地块识别像广西、贵州那些梯田和冲积小平坝田块本身就只有几百平方米20 米像元容易把相邻地块合并出错误边界20 米数据则更适合北方平原、江汉平原这类大面积连片种植区数据量更小处理速度更快做省级汇总统计时精度几乎无差别。两者不是竞争关系而是互补关系。2. 数据生产链路从卫星原始影像到水稻分布图2.1 数据源组合SAR 与光学遥感缺一不可任何做作物遥感的人都知道单用光学影像做水稻识别最怕的就是云。南方水稻生长季恰好是雨季湖南、江西、广东等地在 4 到 7 月经常连续半个月见不到晴空影像Sentinel-2 即使重访周期只有 5 天实际有效观测可能两三个月才能攒够一景干净的。如果完全依赖光学影像早稻识别基本做不了。这套数据集的聪明之处在于把 Sentinel-1 雷达影像和 Sentinel-2 光学影像做了联合使用。Sentinel-1 是 C 波段合成孔径雷达卫星不受云雨影响可以全天候获取地表信息。水稻插秧前后的淹水期在雷达影像上有非常明显的信号特征水面在 VH 极化下的后向散射系数会显著下降比旱地作物低 3 到 5 个分贝这种低后向散射窗口是水稻区别于其他作物的可靠指纹。等到水稻长高封行之后雷达信号又会因为植株与雷达波之间的多次散射而回升形成一条先降后升的曲线。光学影像这边则负责提供精细的植被生长信息。Sentinel-2 的红边波段B5、B6、B7对叶片叶绿素含量和冠层结构非常敏感在稻株封行以后红边指数能很好地区分水稻与旁边的莲藕、茭白等水生作物。两种数据互相补充雷达管淹水期识别光学管生长期确认缺了哪一个识别精度都会打折扣。2.2 水稻的物候指纹是怎么提取的遥感识别水稻本质上是提取物候特征而不是单纯看某一时刻的颜色。水稻和其他作物的最大不同是生长过程中存在一个明确的淹水—移栽事件。这个事件在时间序列上表现为光学植被指数突然下探然后迅速上升、雷达后向散射同步出现低谷。这个特征组合在旱地作物上是找不到的。具体操作上生产流程会先把年内所有时相的影像按时间排序逐像元构建 NDVI归一化植被指数、LSWI陆地表面水体指数、雷达 VH 后向散射系数的三条时间曲线。然后从曲线中提取关键物候参数包括移栽期出现的时间窗口、植被指数上升速率、生长季峰值大小、以及峰值的持续时间。比如东北单季稻的移栽期集中在 5 月下旬到 6 月上旬长江中下游早稻移栽期在 4 月中旬到 5 月上旬两个区域的水稻在物候参数上差别很大模型必须按生态区分别训练。这里有一个容易被忽视的技术细节物候参数提取之前时间序列需要做平滑和缺失值插补。云遮挡、雷达斑点噪声都会造成时序上的毛刺如果不处理算法很容易把一个短暂噪声误判成淹水事件。常用的处理办法是 Savitzky-Golay 滤波加 Whittaker 平滑两种方法我都试过Whittaker 对长时序的保形效果更稳尤其在华南双季稻区域晚稻生长季的后半段经常遭遇台风阴雨数据缺失较多Whittaker 能更好地保留曲线整体趋势。2.3 分类模型的选择与训练水稻识别的分类器这套数据集选用的主流方案是基于物候特征时序的随机森林分类器。随机森林在水稻识别里的优势有两点。第一它对特征之间的非线性关系处理得比较好水稻是否成立往往取决于 NDVI 和雷达信号之间的组合模式而不是单个特征值的大小第二随机森林对训练样本量的需求相对温和在样本不均衡水稻面积远小于非水稻面积的情况下通过调整类别权重仍然能保持不错的召回率。比模型本身更重要的是训练样本的构建。生产方通常会把高分辨率影像、实地调查点、以及农业统计地块结合起来制作样本库再按生态区拆分训练和验证样本。我特别认可的做法是样本点按区域分层采样确保黑龙江、江苏、湖南、广东这些水稻大省都有足够的代表样本而不是简单地从全样本里随机抽否则模型容易偏向样本量大的区域。做过分类的人都知道全国尺度的作物分类最怕的就是区域样本不均衡导致的系统性偏差。2.4 精度验证体系一套遥感数据集如果没有自证清白的验证体系用起来心里是不踏实的。这套数据在精度验证上做了三层设计。第一层是空间抽样验证在分类完成后独立选取验证样本点计算总体精度和 Kappa 系数从公开的验证结果来看主要稻区的总体精度普遍在 85% 到 92% 之间单季稻区域的精度高于双季稻区域第二层是用省级农业统计年鉴数据做面积对比把分类结果的像元数换算成面积与统计播种面积做相关性分析两者相关系数普遍在 0.9 左右第三层是典型区域的人工目视检查选取若干灌区和农场叠加高分辨率影像逐地块核对排查连片错分或遗漏的情况。三层验证下来这套数据的可信度是比较高的。但我提醒一点任何精度指标都是基于特定年份和特定区域的不能把它当作恒定值。比如某一年江汉平原在早稻移栽期遭遇了持续阴雨雷达影像的淹水信号被积水干扰那一年的分类精度可能就会明显下降。使用长时序数据时建议每年单独评估精度不能拿 2019 年的验证结果代表整个序列。3. 数据集的使用说明书3.1 文件组织与命名规则拿到数据集之后第一步是搞清楚文件结构和命名规则。从命名规律来看每个年份一个文件或一个子目录文件名中通常包含年份、数据类型和分辨率等信息。比如以年份开头、跟随水稻标识、再跟上分辨率等级这样的命名规则在 ArcGIS 和 QGIS 里都能直接被识别为栅格文件。文件格式统一采用 GeoTIFF这是目前遥感领域最通用的格式支持压缩、支持地理参考信息内嵌、可以被几乎所有 GIS 软件直接读取。不同年份的数据在图层属性上保持一致方便做逐年的变化检测。我用 QGIS 打开后检查过属性信息像素深度为整数型值域范围规整不需要做额外的色彩映射就可以正常显示。3.2 坐标参考、像素值与空值的说明使用任何栅格数据第一步都逃不开检查坐标系。这套数据采用的是地理坐标系加 UTM 投影分带的组织形式全国数据按分带存储不同分带之间的接边处需要注意重投影。如果你使用 WGS84 经纬度坐标进行分析需要先把栅格投影到目标坐标系如果你处理的是省级范围的数据一般直接用原有的 UTM 分带即可不必强行统一。像素值语义也需要提前确认清楚。通常 1 代表水稻0 代表非水稻但某些版本可能还有 2 代表不确定或边界区域这一点建议打开属性表先确认。空值的位置一般用 NoData 或特定的数值如 255表示在大范围统计分析之前务必要把 NoData 像元排除掉否则统计结果会出现无意义的偏差。3.3 时间维度的使用技巧2017 到 2024 年的逐年数据组成了 8 期时间序列这才是它最有价值的地方。做时间序列分析时我建议你不要只比较相邻两年的栅格差异那样容易把分类噪声当成真实变化。稳妥的做法是先做一步空间滤波或时间滤波空间上使用 Majority Filter 去除孤立小图斑时间上使用连续两年一致才认为是真实变化的逻辑进行变化检测。举个例子某地块 2020 年分类为水稻、2021 年分类为非水稻不能立刻下结论说该地块水稻改种了蔬菜。因为分类本身存在误差真实种植变化往往会持续多年而单年跳变很可能是分类噪声。我会把每年的分类结果转成矢量多边形计算每个地块在 8 年内的种植频率一般以8 年内种植水稻 5 年以上作为稳定水稻田的判定标准这样得到的结果在做政策分析时更有说服力。4. 典型应用场景与扩展思考4.1 种植面积监测与产量建模水稻种植面积是世界公认的粮食安全核心指标但中国目前很多地方仍然依赖逐级上报的统计制度时效性差、人为干扰因素多。这套逐年分布产品可以直接生成市级、县级的种植面积统计与统计部门数据做互验。把像元数乘以单个像元对应的地面面积再进行投影面积修正就可以得到全县水稻面积这个过程在 ArcGIS 里用 Zonal Statistics 工具十分钟就能完成。更深入的应用是和作物模型结合。水稻生长模型如 ORYZA、DSSAT-CERES-Rice需要知道田块位置和种植面积才能做区域尺度的产量模拟。以前很多人用县级统计面积做模型输入空间分辨率不够导致模拟结果要么高估连片区域的产量要么漏掉丘陵地区的分散稻田。用这套 10 米数据作为模型的空间掩膜可以做到田块级驱动模型只在水稻像元上运行模拟结果再按面积加权聚合到行政单元产量估算的空间合理性会提升很多。4.2 稻田甲烷排放核算水稻田是甲烷的重要排放源政府间气候变化专门委员会IPCC的温室气体清单方法要求对稻田面积进行逐年核算。以前做甲烷排放清单时稻田面积大多来自统计年鉴空间位置信息缺失无法和土壤类型、水分管理方式等空间数据叠加。这套数据集把排放核算从总量估算推进到了空间显式估算。具体做法是把水稻分布栅格作为底图叠加土壤有机碳含量图、灌溉设施分布图、以及气象数据结合区域排放因子就能生成甲烷排放的空间分布图。我在做省级温室气体清单时用这套数据把排放量分配到乡镇尺度结果能清楚看出洞庭湖周边和江汉平原的排放热点区域这是纯统计方法完全做不到的。4.3 农业保险定损与灾害评估农业保险在水稻定损中一直面临一个难题受灾时很难快速确定受灾范围内到底有多少实际种植水稻。过去只能靠人工查勘逐村登记效率低且容易有争议。水稻分布栅格可以作为查勘底图保险公司查勘员到达现场后打开手机 GIS 叠加当年的水稻分布图层就能直接锁定查勘重点地块快速估算积水田块面积减少现场工作量。如果连续提供多期数据还能追溯历史种植情况为理赔提供长期依据。这套数据在灾害年份尤其有价值。2020 年长江流域发生严重洪涝湖南、江西、安徽多地稻田被淹。把当年的水稻分布图和洪水淹没范围叠加能快速生成受灾稻田的面积和空间分布辅助救灾物资调配和灾后补种计划制定。遥感数据在这个时候的价值不只是一个图层而是一个决策支持底图。5. 实操中容易踩的坑5.1 分类噪声与空间滤波的平衡直接使用原始栅格进行分类面积统计你会发现一定比例的小碎斑尤其在丘陵地区和城乡接合部。一个像元显示为水稻但旁边两三个像元是非水稻这类椒盐噪声是像素级分类的固有产物。处理方法可以用 Majority Filter、焦点统计或形态学开闭运算但要注意滤波窗口不宜太大3×3 到 5×5 比较合适。窗口过大虽然图面干净了却会把细碎的丘陵梯田整体抹掉反而损失了 10 米数据的高空间分辨率优势。我个人习惯的做法是先用 3×3 Majority Filter 去除单点噪声再把栅格转矢量删除面积小于 500 平方米的图斑。通过这两步处理图面既干净又不丢失真实小田块信息最终面积统计结果和原始数据之间的差异通常能控制在 3% 以内。5.2 双季稻、再生稻的漏分与混分这是这套数据在实际应用里最需要注意的问题。双季稻区域的早稻和晚稻在一年内存在两次种植期如果分类算法对时间序列的划分节点不够精细很容易把早稻、晚稻识别成一季稻或者只识别出其中一季。再生稻的挑战更特殊它第一季收获后稻桩重新发苗形成第二季头季收获后田间并非完全裸露物候信号与双季稻不同分类器容易把再生稻混淆为中稻。如果你做南方区域的精细分析建议先了解目标区域内双季稻和三季稻的分布特点再决定是否要按单季稻、双季稻分别统计面积。在全国产品里如果标注区分了一季稻与双季稻直接按类别字段提取即可如果没有区分就要小心汇总时把双季稻面积乘以两倍或漏掉其中一季。5.3 与官方统计数据的口径差异不少用户喜欢拿遥感面积直接对比统计年鉴面积发现差异超过 10% 就开始怀疑数据本身有问题。这里必须先厘清口径差异统计年鉴的播种面积指的是年内累计播种面积东北水稻只播一季所以统计面积和收获面积一致但华南双季稻区域一亩田一年种两季统计面积按两亩计算而遥感识别的种植分布可能只记录是否种植了水稻并不区分早晚稻。如果不加换算就对比必然产生偏差。另外统计口径的耕地面积是指土地权属和用途遥感识别的是实际水稻种植的地块。存在弃耕、撂荒、临时改种的情况下遥感面积会小于统计面积。所以做对比时我建议明确对比口径、按单双季分别处理、并留出 5% 到 10% 的合理误差区间。5.4 跨年一致性检验长时序研究对分类结果的年际一致性要求极高。实际操作中不同年份的卫星数据密度和云覆盖情况不同分类模型可能在某一年出现区域性偏移。做变化检测前必须进行跨年一致性评估。方法是选取若干从未改变的土地利用类型区域比如城市绿地、自然湿地、多年生果园检查这些区域在不同年份被误分为水稻的比例。如果是稳定区域出现连片的水稻跳变说明该年份存在系统性问题。以我的使用经验为例某一年湖南省数据在多处水体边缘出现了疑似水稻的条带后来分析发现是那年洞庭湖水位异常偏高导致湖滨滩涂暴露算法把季节性淹没滩涂归入了水稻。这种情况不能简单用滤波解决必须结合水体掩膜或地形坡度数据进行剔除我习惯将所有坡度大于 6 度的区域直接排除在水稻候选区之外因为水稻种植基本只发生在平缓地带这一招能快速清除山地误分。6. 我的个人使用体会与进一步建议6.1 数据使用的两个优化方向这套 10米/20米分辨率数据集在实际使用中已经达到生产级水平但有两点值得根据应用场景进一步优化。第一个是建立局部专题图南方稻区的田块边界和灌溉渠系结构已经持续多年使用但数据集中每一年的空间边界是逐像元更新的。在对精度要求极高的场景下我会用自己的地块边界数据对该年分布图做叠置分析以同一地块内水稻像元占比超过 50%作为该地块判定为稻田的阈值相当于做了一次基于对象的细化。第二个优化方向是加入地形约束。全国产品在平原地区表现突出但在丘陵和山区坡度和地块大小的限制很重要。一般来说水稻田很少分布在坡度大于 6 度的坡地上。拿到数据后结合 SRTM 或 ALOS 12.5 米 DEM 做坡度分析把高坡度区域的水稻像元标记出来进行二次复核可以有效排除误分。6.2 这套数据后续还能怎么接从我的经验来看这套数据的长期价值在于它可以作为训练样本源去更新未来年份的作物分类。假设你在 2025 年或 2026 年想继续出水稻分布图不需要重新做全流程分类完全可以把 2017 到 2024 年的稳定水稻种植区域作为先验样本结合当年度 Sentinel-1/2 影像做增量更新分类这样能大大提升产出效率。这个方法适合所有长期依赖遥感数据进行农业监测的团队也是我认为这套数据集最有厚积薄发潜力的应用方向。最后再分享一个小技巧。做长时序监测时不要只把水稻分布图当作一个最终产品来用试着把它与其他公开数据叠加分析比如土壤类型图、降水数据、农业气象灾害数据、甚至夜间灯光和人口分布数据。水稻分布图反映的是谁在种粮叠加其他数据后它就开始回答在哪里种更合适哪里存在气候风险哪里适合作物结构调整这些更难的问题。遥感数据的价值永远在分析链条里而不在于图层本身。