破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!¶
Ch01.720 破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!¶
📊 Level ⭐⭐ | 8.7KB |
entities/破解遥感目标的形状与尺度难题pkinet二代推理提速近4倍.md
破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!¶
source: wechat source_url: https://mp.weixin.qq.com/s/KHflQ4IdAsd3RgyECsj-Zw
ingested: 2026-07-01 feed_name: 新智元 wechat_mp_fakeid: MP_WXS_3271041950
source_published: 2026-06-30¶
破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!¶
¶
¶
** ** ** 新智元报道 **
** 【新智元导读】 卫星和航空影像里的目标,不仅大小相差悬殊,还可能朝向任意方向:一边是细长的桥梁、船舶,一边是密集的小车和大面积运动场。PKINet-v2是一种改进的遥感目标检测模型,能同时处理复杂形状和尺度变化的问题。 **¶
自然图像里的物体通常有较稳定的拍摄视角,遥感影像则不同。
一张高分辨率卫星图中,可能同时出现接近圆形的储罐、狭长的桥梁和船舶、密集排列的小汽车,以及占据大面积区域的足球场。它们的方向可以任意旋转,尺寸也可能从不足10像素的小目标跨越到覆盖大范
核心要点¶
本文为微信公众号文章,由 WeChat backfill 收录。
详细信息¶
source: wechat source_url: https://mp.weixin.qq.com/s/KHflQ4IdAsd3RgyECsj-Zw
ingested: 2026-07-01 feed_name: 新智元 wechat_mp_fakeid: MP_WXS_3271041950
source_published: 2026-06-30¶
破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!¶
¶
¶
** ** ** 新智元报道 **
** 【新智元导读】 卫星和航空影像里的目标,不仅大小相差悬殊,还可能朝向任意方向:一边是细长的桥梁、船舶,一边是密集的小车和大面积运动场。PKINet-v2是一种改进的遥感目标检测模型,能同时处理复杂形状和尺度变化的问题。 **¶
自然图像里的物体通常有较稳定的拍摄视角,遥感影像则不同。
一张高分辨率卫星图中,可能同时出现接近圆形的储罐、狭长的桥梁和船舶、密集排列的小汽车,以及占据大面积区域的足球场。它们的方向可以任意旋转,尺寸也可能从不足10像素的小目标跨越到覆盖大范围的场地目标。
这带来两类问题:
几何复杂性: 目标朝向和长宽比变化很大,细长目标尤其需要沿主轴方向聚合信息;
空间复杂性: 目标尺度跨度极大,模型既要保留小目标纹理,又要看到大范围上下文。
只使用条带卷积,虽然有利于描述桥梁、船舶等细长结构,却可能破坏规则目标的二维空间连贯性,并丢失微小目标的局部细节;只使用方形大核,可以扩大观察范围,却容易在细长目标周围引入更多背景噪声。
换句话说,遥感检测需要的不是一把固定形状的「放大镜」,而是一组能够随目标形态和尺度协同工作的观察窗口。
也就是说,遥感检测模型常常面临一个现实取舍:想让网络「看得更远、更细」,通常要付出更多计算;想跑得更快,又可能损失复杂场景下的检测精度。
南京理工大学、浙江大学等最新提出PKINet-v2同时满足了这两个看似互相矛盾的要求。
PKINet-v2论文: https://arxiv.org/pdf/2603.16341
PKINet-v1论文: https://arxiv.org/abs/2403.06258
项目代码: https://github.com/NUST-Machine-Intelligence-Laboratory/PKINet
在CVPR 2024前作PKINet的基础上,PKINet-v2把条带卷积与多尺度方形卷积统一起来,并将训练时的多分支结构等价折叠为部署时的单个大核。
在Oriented R-CNN统一设置下,PKINet-v2-S相较PKINet-v1-S提升2.07个mAP百分点,FPS从14.05提高到54.60,约为前作的3.9倍。
在DOTA-v1.0单尺度训练和测试、Oriented R-CNN检测器的统一设置下,标准版PKINet-v2-S取得80.46 mAP,相比PKINet-v1-S的78.39提高2.07个百分点。
与此同时,完整检测模型的FPS由14.05提高到54.60,约为前作的3.9倍;参数量从30.8M略降至30.7M,FLOPs也从184G降至173G。
更重要的是,这种提升并不依赖某一个特定检测头。把PKINet-v2接入Rotated FCOS、R3Det、S²ANet、RoI Transformer、Rotated Faster R-CNN和Oriented R-CNN后,相比PKINet-v1分别获得2.27、1.75、1.85、2.70、2.57和2.07个mAP百分点的提升。
图1 在多种旋转检测器上,PKINet-v2的运行点整体向「更高精度、更高FPS」移动
这里的速度均来自论文给定的单张NVIDIA A100-40G GPU测试环境,不能直接等同于无人机、边缘芯片或星上设备的实际帧率,但它说明新骨干在统一硬件条件下显著减少了推理开销。
** 从PKINet到PKINet-v2 **
PKINet采用无空洞的并行多尺度方形卷积,提取不同尺度目标及其局部上下文,并通过Context Anchor Attention(CAA)补充长程信息。其在DOTA-v1.0、DOTA-v1.5、HRSC2016和DIOR-R等基准上的结果,为Poly-Kernel路线提供了稳定验证,也成为PKINet-v2的直接起点。
PKINet-v2并非另起炉灶,而是围绕前作仍可改善的几何适配、计算冗余和部署效率,完成四项升级:
- 从「多尺度建模」走向「几何与空间协同建模」。 PKINet-v1的3×3至11×11方形卷积主要应对尺度变化;PKINet-v2进一步加入横向和纵向
原文¶
→ 原文存档
关联¶
- 相关概念: Harness Engineering