过去几年无人机低空航拍已经非常普及但多数应用还停留在“拍得清、看得见”的阶段一张正射影像、一段可见光视频再叠加人工判读。真正让无人机从工具变成“会思考的眼睛”的是它能不能在三维场景中回答更复杂的问题——这栋建筑多高、电线离树有多远、哪个区域发生了新的塌方、地面车辆如何分布。在 CEIC 2026 上北京航空航天大学史振威教授分享了题为《低空三维遥感场景智能感知研究进展》的报告。只看题目很多人会把它归类为“遥感圈子”的学术报告但细看主题的两个关键词会发现它其实切中了当前低空经济、无人系统、三维视觉和 AI 感知交汇的核心议题低空三维遥感不再只是“用无人机拍三维模型”而是要在三维空间里做智能感知和理解。我认为这篇报告真正值得关注的地方在于一个明确的技术判断低空遥感智能感知的瓶颈正在从“数据获取和三维重建”慢慢转移到“场景理解与模型泛化”。换句话说过去五年大家关心的是怎么把场景建得精细未来五年要解决的是怎么让模型在低空场景下稳定地“看得懂”。这篇文章不打算替任何人复述报告原文而是围绕“低空三维遥感场景智能感知”这个主题把技术概念、完整链路、关键难点、可借鉴的研究路线和工程落地路径拆开讲清楚方便对低空感知感兴趣的开发者、算法工程师和研究生快速建立整体认知。1. 低空三维遥感智能感知为什么突然重要了1.1 低空经济把无人机的角色从“拍摄设备”变成了“感知终端”最近两年低空经济成为产业热点无人机从消费级航拍走向巡检、物流、应急、城市治理等生产场景。生产场景和娱乐场景最大的区别是系统可以不要“拍出来好看”但一定要“测得准、判得对”。举一个很典型的场景电力线路巡检。过去无人机沿着电线飞一圈拍回大量可见光照片由人工在电脑前逐张查看绝缘子是否破损、树线距离是否过近。一个人一天最多看几百张图且容易疲劳遗漏。如果把这个问题交给智能感知系统它需要通过可见光、激光点云或三维重建结果实时判断导线的空间位置、树木的生长高度、绝缘子是否存在缺陷。这时系统需要的不是单张图片分类而是三维场景下的目标定位和语义理解。这就是低空三维遥感智能感知的用武之地它面对的往往不是“识别出画面里有什么”而是“在真实的三维坐标里目标在哪里、朝向怎样、相互距离是多少、是否构成风险”。1.2 从“二维影像”到“三维场景”是一次范式变化我观察到很多团队一开始会把低空三维感知理解为“用无人机拍图再跑一个目标检测模型”。但实际上二维感知和三维场景感知的差异并不是多了一个深度通道而是整个数据表达和推理范式都变了。二维目标检测解决的是图像坐标系下的分类和回归问题。三维感知要解决的是世界坐标系下的空间理解问题。后者至少多出三个难点目标不再只是像素框而是在三维空间中有位置、尺寸、朝向场景中的遮挡和视角变化远比想象中严重模型必须在连续空间里保持时空一致性。所以低空三维遥感智能感知不是某一两个模型的改进而是从传感器配置、数据标注、三维表达、模型设计到评测指标的一整套链路升级。这一章想表达的重点是低空三维遥感智能感知的火热有产业需求的推动也有技术路线演进的必然。对开发者来说提前理解这条链路比单纯追某个新模型更有价值。2. 核心概念低空遥感、三维遥感与场景智能感知在往下拆解之前先把三个词的定义和边界说清楚。这三者经常被混用但解决的不是同一层问题。概念核心信息典型数据主要回答的问题低空遥感飞行平台在低空采集对地观测数据无人机影像、视频、激光点云、多光谱数据场景“长什么样”三维遥感从数据中恢复三维几何和结构密集点云、三角网、数字表面模型、实景三维模型目标“在哪里、多高、什么形态”场景智能感知在三维场景中进行目标识别、语义解析和态势理解三维目标框、语义分割掩膜、变化检测结果场景里“有什么、什么状态、有没有风险”2.1 低空遥感与卫星遥感、有人机航空遥感的区别低空遥感通常指利用无人机等低空平台在几百米以内高度获取高分辨率对地观测数据。它和卫星遥感、有人机航空遥感相比特点是灵活、近距离、高重叠率、可多角度悬停观测。卫星遥感的优势是覆盖范围大、重访周期固定但受天气和云层影响明显空间分辨率往往达不到厘米级而且很难对同一目标做多角度环绕观测。有人机航空遥感精度高但成本高、调度慢。无人机低空遥感则把“局部区域的厘米级高频观测”做成了低成本、可重复、可定制的事情。这带来一个有意思的结果低空遥感的数据形态天然适合三维重建和智能感知因为无人机可以在很短时间内围绕目标获取大量重叠影像甚至可以通过倾斜摄影得到立面纹理。2.2 三维遥感从影像点云到实景三维模型三维遥感的核心是“几何”。低空平台获取的二维影像通过多视几何恢复相机姿态和稀疏点云再经过稠密重建生成密集点云和网格最终形成实景三维模型。除了可见光重建激光雷达也是三维遥感的重要数据来源。LiDAR 直接测量目标的三维坐标不受光照影响对植被穿透力强适合获取高精度地面信息。影像和 LiDAR 各有优势影像纹理丰富LiDAR 几何精确。实际研究中两者融合已经很常见。2.3 场景智能感知目标检测、语义分割与变化检测场景智能感知不局限在“识别目标”而是要把单帧识别升级为对整个低空场景的理解。它至少包括三件事目标检测与定位在三维空间中找到目标比如车辆、房屋、杆塔、树冠语义分割与分类给每个点或体素赋予语义标签把场景分成建筑、道路、植被、裸地等变化检测与态势分析对比不同时相的数据判断哪里发生了新增、移除或异常。理解这三个层级之后再看史振威教授的报告题目就能明白《低空三维遥感场景智能感知研究进展》覆盖的是一条完整的研究链路而不仅仅是某一个算法。这也是这篇文章反复强调的核心判断低空三维遥感智能感知本质上是一个多技术高度耦合的系统性问题。3. 一条完整的技术链路从数据采集到场景理解低空三维遥感智能感知可以拆成四层技术栈每一层都对应不同的工程任务和科研问题。3.1 数据获取层低空平台通常搭载可见光相机、多光谱相机、热红外相机和激光雷达等传感器。采集时要考虑航线设计、影像重叠率、光照条件、飞行高度和风速。飞行高度越低地面分辨率越高但覆盖范围就越小采集效率越低飞行高度越高覆盖范围越大但小目标细节可能丢失。采集阶段很容易被忽略的一个问题是“数据质量并不只由传感器决定”。相机标定是否准确、GPS/IMU 精度是否足够、航线重叠率是否满足后处理要求都会直接影响三维重建和智能感知的效果。3.2 三维重建层拿到影像和点云之后需要把分散的观测数据对齐到统一的三维坐标下。主流做法是运动恢复结构和多视立体也就是常见的 SfM 和 MVS。流程包括特征提取、特征匹配、相机姿态估计、稀疏点云生成、稠密重建、网格生成和纹理映射。激光雷达的流程略有不同主要是点云配准、航带平差、点云分类和地面滤波。影像重建的优势是纹理真实LiDAR 重建的优势是几何精度高。两者融合时还需要解决配准和坐标统一问题。3.3 智能感知层感知层的输入是重建后的三维数据也可能是原始影像序列。感知任务包括目标检测、语义分割、实例分割、关键点检测、变化检测等。这里要特别说明一个容易混淆的点三维感知不一定非要用三维模型作为输入。很多工程系统会先在单张影像上做二维检测再通过深度信息和相机参数把结果投影到三维空间。这种“二维检测三维投影”的方案实现成本低但对遮挡、重叠目标和纹理弱区域不够鲁棒。另一类方案直接基于点云或体素做三维分割、检测和分类精度潜力更大但数据要求和计算开销也更高。3.4 应用生成层感知结果最终要落到业务里。比如电力巡检中感知层输出“绝缘子位置”“导线弧垂”“树线距离”应用层才能自动生成缺陷报告和检修工单在应急救援中感知层输出“倒塌建筑区域”“道路阻断位置”指挥系统才能规划救援路径。链路设计有一个关键经验越早考虑应用层需求越能在数据采集和感知模型设计上少走弯路。如果业务根本不关心某个目标类别就不要让模型去学习那个类别如果需要知道目标的精确地理坐标那么从采集时就要把坐标系和精度要求纳入设计。4. 从二维感知到三维感知难点到底在哪现在很多开源模型在 COCO、Cityscapes 上表现不错但搬到低空无人机场景后效果大打折扣。问题通常不出在“网络结构不够先进”而出在任务定义和数据形态差异上。4.1 视角差异低空视角与水平视角完全不同大部分公开视觉数据集是水平视角拍摄的目标尺度变化不剧烈遮挡关系相对稳定。低空无人机影像则多为俯视或大角度倾斜视角同样一个目标在不同角度下的外观差异非常大。一辆轿车从正上方看和从侧面看几乎像是两种物体一个杆塔在不同航线角度的投影也完全不同。这直接影响模型泛化能力在常规自然图像上预训练的模型并不天然适配低空视角。领域迁移是绕不开的问题。4.2 目标尺度跨度大既要有大范围又要有小细节低空三维遥感场景的特点是“跨尺度”。一张低空影像里可能同时包含大片的建筑、道路和只有十几个像素的绝缘子、电线、小鸟。目标检测模型往往对尺度变化敏感小目标容易出现漏检。最直接的办法是提高输入分辨率但会带来推理速度下降另一种做法是切块检测但会增加后处理复杂度。4.3 标注成本高从二维框到三维理解标注难度指数级上升二维目标检测的标注只需要画框三维感知的标注要考虑目标的深度、朝向、遮挡和语义类别。一个二维标注可能只需要几秒一个高质量的三维语义分割标注可能花费几十分钟。标注成本已经成为低空三维感知研究的主要瓶颈之一。也正因为这一原因弱监督、自监督、主动学习和半自动标注路线在低空遥感领域受到越来越多的关注。4.4 光照与天气变化真实场景不可能都在晴天作业低空作业会遇到逆光、阴影、雨雾、扬尘等复杂条件。可见光影像对这些条件非常敏感而 LiDAR 受光照影响小但点云稀疏且缺乏纹理。如何实现多模态互补而不是简单拼接是目前研究的一个核心难点。4.5 实时性巡检和应急场景不允许“先跑三天重建”离线三维重建可以花几小时甚至几天处理数据但很多低空感知任务要求在线或近实时完成。比如电力巡检中无人机飞行时就要发现异常应急场景中更希望边飞边传、边传边判。实时性约束会直接影响模型选型和部署架构这也是工程落地时非常容易低估的问题。总结一下低空三维智能感知的难度不在于某一个模型不够强而在于视角迁移、尺度变化、标注稀缺、天气干扰和实时性约束同时出现。这些问题相互耦合很难用单点技术彻底解决。5. 当前可借鉴的研究路线与进展从近几年的研究趋势看低空三维遥感场景智能感知有几条比较清晰的技术路线值得算法团队重点跟踪。5.1 多模态特征融合让几何与影像互相补充单一模态很容易遇到瓶颈。影像在弱纹理和阴影区域容易失效纯点云在区分相似目标时缺少语义线索。近年来的趋势是把可见光影像、LiDAR点云甚至热红外数据做特征级融合利用影像的纹理信息辅助点云分类利用点云的几何信息辅助影像目标定位。工程上常见的做法有两种一是把点云投影到图像平面在像素级完成特征对齐二是把图像特征反投影回三维空间在三维空间中做融合。前者依赖准确的标定后者对坐标误差更敏感。5.2 大规模预训练模型与遥感适配视觉基础模型在自然图像上取得了很大进展但直接迁移到遥感影像上并不顺畅。一个主要原因是遥感影像是垂直视角或大倾斜视角纹理和背景分布与自然图像差异明显。越来越多的团队开始针对遥感影像做专门预训练通过在大量无标注遥感影像上进行掩码自监督学习让模型先学透遥感数据的通用表达再微调到具体任务上。这条路线在数据标注有限的场景下尤其有价值。5.3 从全监督走向弱监督和自监督由于三维标注成本极高弱监督和自监督方法成为研究热点。基本思路是用少量人工标注或图像级标签配合数据自身的空间一致性约束训练三维感知模型。例如先用二维目标检测器在大规模二维影像上生成初步目标位置再通过多视角几何把二维预测投影到三维空间生成带噪声的伪三维标签用于训练三维模型。这个流程虽然不完美但可以大幅降低标注成本在工程上可行性很高。5.4 场景感知与生成式三维表示结合近年神经辐射场和三维高斯泼溅等三维表示方法兴起给低空三维感知提供了新的数据表达方式。这类方法具备从稀疏视角合成新视角的能力同时也能提供连续的三维几何表征。可以预期生成式三维表示会成为低空三维感知的重要研究方向尤其在数据增强、视角补全和高质量重建方面。不过我要提醒一点这些新技术距离成熟工程落地还有一定距离尤其是在大场景、实时性和密集目标场景下需要继续观察。把它当作研究探索方向合理但如果生产项目追求稳定不妨先采用相对成熟的三维重建和感知方案。6. 典型应用场景与落地价值低空三维遥感智能感知如果只停留在论文里很难体现价值。从落地角度看下面几个场景是公认的刚需。6.1 电力通道巡检电力线路往往穿越山区、林区巡检难度大。低空平台沿着线路飞行传感器同时采集可见光和激光点云。智能感知系统需要识别杆塔、绝缘子、导线并计算导线与树木、建筑之间的距离。树线距离超标的判断只有三维数据才能给出较准确的结果二维影像很难量测真实距离。6.2 应急救援与灾害评估应急场景要求反应快、信息全。灾害发生后无人机可以快速进入现场通过三维重建生成受灾区域的数字高程模型和正射影像感知系统再检测房屋坍塌、道路阻断、车辆受损等情况。这类任务对“从数据到结果”的整体时效要求很高如果在重建环节就花费数小时参考价值会大幅下降。6.3 城市精细化治理在城市管理场景中低空三维感知可以做违建监测、工程进度管理、道路病害检测、渣土车识别等。违建监测的关键是月与月之间的三维变化检测工程进度管理需要按周计算土方量和建筑结构变化。这些都不是单张图能解决的需要稳定的三维场景对齐和时序分析能力。6.4 农林植保与生态监测农业场景中无人机通过多光谱影像计算植被指数结合三维点云可以估算作物高度、倒伏面积和叶面积指数。林业场景中通过 LiDAR 点云可以提取单木位置、树高和冠幅为森林蓄积量估算提供依据。6.5 交通与安防低空视角下的交通目标识别可以统计车辆数量、判断拥堵程度、识别异常停车。安防场景中三维感知可以帮助定位可疑目标在园区内的精确位置并跟踪其运动轨迹。这些场景看起来差别很大但底层技术高度一致都要完成定位、识别、量测和理解。这也是低空三维遥感智能感知可以作为一个统一研究方向存在的原因。7. 实践演练从点云、重建到感知评估的最小流程对刚接触这个方向的开发者来说与其直接读大量的综述和论文不如先把一条最小链路跑通。下面给出一个低门槛的实践路径代码以常见的开源工具为主。7.1 环境准备建议使用 Python 3.8 或更高版本打开命令行创建独立环境python -m venv lowaltitude source lowaltitude/bin/activate # Windows 下使用 lowaltitude\Scripts\activate pip install numpy open3d laspy matplotlib三维重建部分可以选择安装 COLMAP直接从官方项目页面下载对应系统版本即可。COLMAP 是学术界和工业界常用的 SfM/MVS 开源工具适合处理中小规模场景。7.2 读取并查看激光雷达点云低空遥感项目中最常见的数据之一是 LAS 或 LAZ 格式的点云文件。使用 laspy 读取点坐标和颜色再用 Open3D 做可视化# 文件路径inspect_pointcloud.py import numpy as np import laspy import open3d as o3d las laspy.read(scene.laz) points np.vstack((las.x, las.y, las.z)).T colors np.vstack((las.red, las.green, las.blue)).T # 常见的 16 位颜色值归一化到 [0, 1] if colors.max() 255: colors colors / 65535.0 else: colors colors / 255.0 pcd o3d.geometry.PointCloud() pcd.points o3d.utility.Vector3dVector(points) pcd.colors o3d.utility.Vector3dVector(colors) o3d.visualization.draw_geometries([pcd])运行方式python inspect_pointcloud.py如果能弹出一个三维点云窗口说明环境正常。这一步的主要目的是确认数据是否完整、坐标系是否符合预期、是否有明显的噪声点。建议先看数据再谈模型。很多算法问题其实在数据可视化阶段就能发现一半。7.3 通过多视角影像重建稀疏点云如果你手头只有无人机可见光影像可以用 COLMAP 做一个标准的 SfM 流程。把影像放在一个文件夹内按如下命令执行# 1. 特征提取 colmap feature_extractor \ --database_path project/database.db \ --image_path project/images # 2. 特征匹配影像数量不大时使用精确匹配 colmap exhaustive_matcher \ --database_path project/database.db # 3. 增量式稀疏重建 colmap mapper \ --database_path project/database.db \ --image_path project/images \ --output_path project/sparse # 4. 导出 PLY 点云方便后续可视化 colmap model_converter \ --input_path project/sparse/0 \ --output_path project/sparse/0/points3D.ply \ --output_type PLY要注意影像拍摄质量直接决定重建结果。影像之间重叠率不够、运动模糊过大、光照变化剧烈都会让特征匹配失败。如果重建结果很差优先检查影像而不是参数。7.4 二维检测结果投影到三维坐标低空感知中经常需要把二维检测框和三维空间关联起来。如果已知相机内参和目标的深度可以通过针孔相机模型把像素坐标换算到相机坐标系# 文件路径project_pixel_to_camera.py import numpy as np def pixel_to_camera(u, v, depth, K): fx K[0, 0] fy K[1, 1] cx K[0, 2] cy K[1, 2] x_cam (u - cx) * depth / fx y_cam (v - cy) * depth / fy z_cam depth return np.array([x_cam, y_cam, z_cam]) # 假设相机内参和像素坐标深度单位与三维场景保持一致 K np.array([ [918.0, 0.0, 960.0], [0.0, 918.0, 540.0], [0.0, 0.0, 1.0] ]) # 对影像中心点假设置深度 25 米 point_cam pixel_to_camera(960, 540, 25.0, K) print(相机坐标系下的三维位置(米):, point_cam)这段代码是示意性质实际工程中“深度从哪来”才是难点。深度可以来自 LiDAR 点云、立体匹配、深度估计神经网络或者先验尺寸假设。不同的深度来源决定了三维定位误差的分布。7.5 感知模型评估从 IoU 开始做目标检测和语义分割绕不开 IoU 这个指标。下面用一个最小示例展示如何计算两个矩形框的 IoU# 文件路径iou_demo.py def compute_iou(box_a, box_b): # box 格式: [x1, y1, x2, y2] x1 max(box_a[0], box_b[0]) y1 max(box_a[1], box_b[1]) x2 min(box_a[2], box_b[2]) y2 min(box_a[3], box_b[3]) inter_w max(0, x2 - x1) inter_h max(0, y2 - y1) inter inter_w * inter_h area_a (box_a[2] - box_a[0]) * (box_a[3] - box_a[1]) area_b (box_b[2] - box_b[0]) * (box_b[3] - box_b[1]) return inter / (area_a area_b - inter) pred [100, 100, 200, 200] gt [120, 120, 220, 220] print(IoU:, compute_iou(pred, gt))IoU 虽然简单但在低空遥感目标检测里有一个常见陷阱目标过小时一个像素的偏差就可能导致 IoU 很低模型看起来不达标实际上可能是标注和检测框尺度差异。评估时一定要结合目标尺寸分析指标而不是只看一个平均 mAP。7.6 如何用最小流程获得判断力从点云可视化到多视角重建再到二维到三维的投影和基础指标计算这四步跑完基本就能理解低空三维遥感和智能感知的链路。很多初学者直接上来就训练一个检测模型忽略了数据质量和三维空间关系的理解结果模型怎么调都不收敛。先跑通最小链路是性价比最高的入门方式。8. 常见误区与排查思路低空三维遥感智能感知涉及环节多容易踩坑。下面整理了我认为最典型的几类问题和排查建议。问题现象可能原因排查方式解决方案点云与影像对不齐传感器标定参数不准或者采集时间不同步检查内外参标定文件在两个模态数据中找明显特征对比重新标定相机与 LiDAR统一坐标基准三维重建出现破洞或扭曲影像重叠率不足、弱纹理区域过多、运动模糊查看重建日志的注册影像数量和平均重投影误差补拍影像提高重叠率避免光照过强或过暗小目标漏检严重输入分辨率低特征提取后目标信息损失统计目标尺寸分布查看特征图感受野切块推理、提高输入分辨率或专门设计小目标分支模型训练集 mAP 很高但现场效果差训练数据与目标场景分布不一致对比训练集和现场数据在视角、光照、背景上的差异增加现场数据微调做域适应或数据增强三维感知输出不稳定时序数据之间坐标漂移检查连续帧位姿估计和坐标系一致性引入全局优化使用地理参考控制点校正除此之外还有一个很普遍的认知误区认为公开数据集上评测好的模型部署到自己的低空平台上也能马上好用。实际上低空感知的传感器安装位置、飞行高度、天气条件和场景背景差异都会造成明显性能波动。任何模型从论文环境到现场环境都需要重新验证和微调。9. 工程化建议与后续学习方向9.1 数据规范化是工程化的第一优先级低空三维感知项目里数据规范化的价值经常被低估。建议从第一天就统一坐标系、时间戳、命名规则和标注格式。影像和点云文件按照任务、日期、架次、传感器类型组织路径。坐标系使用统一的地理参考基准建议记录每一条数据的相机内参、外参和精度信息。这样做的原因是后续所有模型训练、评估、融合和多批次对比都建立在数据可比的基础上。9.2 模型选择与算力规划低空感知的模型选择要分场景。离线制图和巡检任务对实时性要求不高可以使用大模型追求精度应急搜救和在线巡检则要优先考虑轻量化模型和边缘推理设备。算力规划要覆盖训练和推理两端。训练阶段建议优先用已有预训练模型做微调而不是从头训练。推理阶段需要明确帧率要求再决定是用 GPU 服务器、Jetson 类边缘设备还是云端推理。9.3 评估体系要贴近业务学术指标之外业务指标更重要。电力巡检真正关心的是缺陷漏检率和误报率应急场景关心的是从数据采集到结果输出的总延迟林业监测关心的是单木胸径和树高估算误差。建议每个项目建立“学术指标业务指标”的双层评估体系并在项目启动时定义好。9.4 合规与安全低空飞行涉及空域管理、飞行安全和隐私保护。做技术开发和实验时务必遵守所在地区关于无人机飞行的法律法规。涉及真实用户数据和敏感地理信息时应遵循最小必要原则做好数据脱敏和访问控制。这部分不是走过场而是项目能否长期稳定运行的前提。9.5 后续学习方向如果对低空三维遥感智能感知这个方向感兴趣可以从四个维度继续深入三维视觉基础多视图几何、相机标定、点云处理、三维物体检测遥感数据处理影像配准、正射纠正、数字表面模型生成、LiDAR 点云分类深度学习与感知目标检测、语义分割、自监督预训练、多模态融合系统与工程边缘计算、模型部署、时空数据库、自动化标注平台。同时建议持续关注三维高斯泼溅、视觉基础模型如何适配遥感视角、以及弱监督三维感知等方向。这些研究主题与低空三维遥感场景智能感知的结合未来两年很有可能会带来新的突破。低空三维遥感场景智能感知本质上是一个横跨摄影测量、计算机视觉和人工智能的交叉方向。它既有很强的学术价值也有清晰的应用出口。对于做工程的同学建议先跑通最小链路用真实数据建立体感再逐步深入算法细节。把这条技术链路的“数据—重建—感知—评估”想清楚比追任何一个热门模型都更重要。