
A |

B | 这不是科幻场景,而是现代计算机视觉系统正在努力攻克的真实难题。复旦大学的研究团队最近拿出了一套名叫SAM-MT的新方案,在这个问题上迈出了关键的一步。2026年8月8日,全国第18个全民健身日,2026年全国岩馆联赛在广州普岚攀岩馆启幕,来自广东省及周边地区的百余人参赛者同场竞技,中国登山协会主席、国际著名登山家李致新亲临现场并宣布赛事开幕。此站赛事由广东省攀岩协会与普岚攀岩(广州)体育发展有限公司承办,中攀体育文化传播(北京)有限公司运营,广东省青少年体育联合会与广州市番禺区文化广电旅游体育局提供支持,广州良仓新造产业运营管理有限公司协办,中国体育彩票担任公益合作单位。(现场嘉宾合影)全国岩馆联赛由国家体育总局登山运动管理中心、中国登山协会主办,以全国经营性岩馆为核心,服务广大攀岩爱好者为宗旨;通过“创新的比赛形式、有趣的竞赛设置、专业的线路组合、安全的赛事保障”, 打造年度持续时间最长、覆盖年龄范围最广、参与人数最多的全国攀岩爱好者交流、切磋、相聚的国家级全民健身盛会。 当前业界最强的视频目标分割工具——比如大名鼎鼎的SAM2(Segment Anything 2,由Meta AI开发)——虽然能够精准地在视频里"圈出"某个物体并持续追踪它,但有一个致命的弱点:每多追踪一个目标,系统就要多跑一遍完整的计算流程,就好像一个厨师,无论做几道菜,都必须把整个厨房从头收拾一遍才能下锅。追踪1个目标时,SAM2能跑到每秒37帧的流畅速度;但追踪3个目标时,速度就跌到17.8帧;追踪5个目标,更是只剩12.4帧——画面已经开始出现明显卡顿。如果目标再多,整个系统几乎就跑不动了。 SAM-MT的核心思路,就是彻底改变这种"追一个、算一遍"的低效模式,让系统无论面对多少个目标,计算量都几乎保持不变。结果相当令人印象深刻:追踪10个目标时,SAM-MT仍然能跑到36帧以上的实时速度,与追踪单个目标时几乎无异,是SAM2在同等条件下的6倍速度。与此同时,它在六个主流视频分割基准测试上的准确率,依然与SAM2的最强版本旗鼓相当,甚至在部分场景下略有超越。 一、多目标追踪的老大难:为什么加一个目标就慢这么多 要理解SAM-MT解决了什么问题,得先搞清楚传统方法是怎么运转的,以及它在哪里卡了壳。

C | 完成攀岩赛事拼图 打造最具时尚潮流属性的群众体育赛事今年7月份发布的《体育强国建设“十五五”规划》明确提出,要丰富群众赛事活动,办好全国性群众赛事活动,广泛开展 “全民健身日”等全民健身主题活动;支持开展新兴时尚运动等群众喜闻乐见的赛事活动,完善群众赛事活动办赛指南、参赛指引,提升规范化办赛水平。

D | (选手比赛中)在8月8日“全民健身日”启动全国岩馆联赛可谓目标非常明确——打造最具市场潮流属性的群众体育赛事。 视频目标分割,通俗地说,就是在视频的每一帧里,把你指定的那个东西(比如一只猫、一辆红色轿车)精确地"涂出来",并且随着视频播放,这个"涂色区域"要始终跟着目标走,不跑偏、不认错。自1987年引入国内,攀岩运动历经30多年的发展,早已走出户外岩壁,走进大众生活。这个任务背后最流行的技术框架叫做"时空记忆网络"(STM范式),核心思路是给每个被追踪的目标建一个专属的"记忆本",记录这个目标历史上长什么样、在哪里出现过,然后在新的一帧里,把当前画面和记忆本做比对,找到目标的位置,再精确地把它圈出来。尤其是在“入奥”战略的带动下,攀岩项目已经成为中国乃至全球体育运动爱好者喜爱的潮流运动。潮流热度与奥运荣光在攀岩运动身上融为一体,全国岩馆联赛兼顾大众休闲体验与规范竞技属性,打造专属于中国体育爱好者最喜爱的时尚群众体育赛事。据了解,2026年将在全国举办70余场赛事。 这个记忆本是非常"厚重"的——它存储的是像素级别的特征图,一张高清图片里有数千个像素点,每个点都要记录一套复杂的特征描述。追踪一个目标,维护一本记忆本;追踪两个目标,就得同时维护两本——不仅如此,每处理一帧新画面,所有的比对、更新、解码操作都得对每本记忆本各做一遍。通过举办场次地持续增加,赛事让更多的体育爱好者通过竞技比赛感受到攀岩项目的魅力,带动更多身边的人来参加比赛、分享比赛。随着全国岩馆联赛的不断升级,它也补齐了我国攀岩赛事体系的最后一块拼图,构建起从大众岩馆基层到高水平竞技的完整赛事链条。全新竞赛设置 竞技水平与参与热度全拉满为了让更多的攀岩爱好者能够感受到项目的魅力,今年比赛在项目设置、晋级层级以及报名选手年龄等方面都进行了优化。这就像一个办公室职员,每多接手一个客户案例,他就要把整套接待流程完整地走一遍,客户越多,他就越忙,而且是线性地越来越忙,没有尽头。

E | 根据竞赛规程规定,今年的岩馆联赛竞赛项目统一设置为难度赛(L)、攀石赛(B)和速度赛(S),各项目独立计算积分并分别进行排名。

F | 赛事分为基础普及层——俱乐部级(岩馆级)、区域晋级层——省级、年度荣誉层——全国总决赛;俱乐部各级别积分排名前10名的晋级省级赛事,省级赛事各小组积分排名前3名晋级全国总决赛。(选手比赛中)今年的全国岩馆联赛揭幕战,参赛阵容中不乏顶尖高手,包括知名运动员刘加、黄伟君,全国青少年赛事高水平运动员黄榕,以及刚刚结束广东省运会征战的聂可、彭晨曦、张以琳等新生代力量。 后来出现了STCN、XMem、Cutie等改进方案,它们做了一个聪明的优化:提取图像特征这一步,可以所有目标共享,只算一次。这确实减少了一部分重复计算,但问题的根源没有被触动——每个目标的"专属记忆匹配"和"专属掩码解码",仍然需要独立地跑一遍。

G | 打个比方,这就像多个厨师共用一台打蛋机来打蛋液,但每人还是要独立地完成切菜、炒锅、摆盘全套流程。共用的那台机器省了点时间,但整体的忙碌程度仍然随人数线性增长。此外,高校教师、资深岩友等各领域攀岩爱好者也踊跃报名,既有专业高度,又有广泛群众基础,赛场竞技水平与参与热度双双拉满。以点带面示范效益 助推岩馆运营规范化升级为了规范全国岩馆联赛的体系建设,夯实攀岩项目大众普及根基,今年在全国征集了16个省(自治区、直辖市)的攀岩项目主管单位作为所在省级的唯一执行主体,负责组织所在区域俱乐部级赛事与省级赛事,并承担技术支持、安全监督、数据汇总、宣传联动及人员管理等工作。 还有一种听起来聪明、实则行不通的方法:干脆把所有目标合并成一个大目标来追踪。比如同时追踪三辆车,就把三辆车的轮廓合并成一个奇形怪状的大轮廓,当成一个目标来处理。(现场嘉宾与执裁人员合影)在此次全国岩馆联赛揭幕战的赛事组织层面,为践行“给业余爱好者一个舞台”的核心理念,广东省攀岩协会派出了精英骨干裁判团队执裁。这样确实只用算一遍,但代价是失去了"谁是谁"的身份信息——你不再知道这是第一辆车还是第三辆车——而且这个合并出来的怪形状,在现实世界中根本不存在,AI模型是用真实物体的图片训练出来的,它根本认不出这个东西,很快就会追丢。即便是普通岩友参赛,也能体验到顶尖赛事的执裁标准与专业服务。论文里专门做了实验验证这一点:让SAM2追踪三辆合并后的"超级车",很快就彻底失去了目标。

H | 二、SAM-MT的核心思路:用"通缉令"代替"全程录像" SAM-MT的解法,可以用一个侦探团队办案的比喻来理解。(比赛场地)作为揭幕战的承办场馆,广州普岚攀岩馆凭借出色的硬件设施成为赛事的一大亮点。 传统方法就像这样:团队里有10个嫌疑人需要监视,就派10个侦探,每人全程跟踪一个嫌疑人,各自记录详细的行动录像,互不干扰,但人手成本随嫌疑人数量线性增长。场馆拥有超过2000平方米的攀爬空间,引入巴黎奥运会同款岩壁,硬件配置向国际顶尖标准看齐。 SAM-MT换了一种玩法:整个团队共享一套城市监控系统(这是"全局上下文"),掌握所有嫌疑人所在区域的大环境信息;同时,每个嫌疑人只有一张精简的"通缉令"(这就是"目标查询",target query),上面记录了这个人的关键特征。场馆毗邻全运会赛场,日常便是众多职业选手的定点训练基地,被誉为广州攀岩的“高手聚集地”。馆内线路设计以“硬核”著称,难度体系完善,能够全面满足从新手体验到专业竞技的多样化需求。侦探们用共享的监控系统扫描全局环境,同时拿着各自的通缉令在里面找对应的人,一次扫描,所有人同时完成比对。攀岩参与人群和经营性岩馆主体迅猛发展,为群众攀岩向纵深发展提供了广阔空间,行业规范化发展也迫在眉睫。据了解,在开展全国岩馆联赛的同时,全国岩馆星级评标准也同步启动,逐步完善主管单位对全国岩馆的服务、引导和规范,健全攀岩运动全民健身服务体系,让更多的民众安全、快乐地参与攀岩运动,持续推动攀岩运动的健康、可持续发展。随着揭幕战的成功打响,全国岩馆联赛后续将在全国各地陆续展开分站赛角逐,赛事版图将覆盖更多城市,让更多岩友在家门口就能参与到国家级攀岩赛事中来,持续点燃全民攀岩热情。

I | 如果去掉隔离屏障,让所有目标的查询自由混合,准确率(J&F指标)会从43.0骤降到37.5,足足跌了5.5个百分点;反过来,如果把隔离做得过头,连全局查询也被隔离,准确率则降到39.3,跌了3.7个百分点。

J | 只有"解耦"这个恰到好处的中间状态,才能同时保住身份和上下文。 四、查询聚合:把多个"线索"压缩成一张"通缉令" 在用户第一次指定目标时,可以对同一个目标点多个点(正点击表示"这里是我要追踪的",负点击表示"这里不是"),提供更精确的初始描述。这些多个点会产生多个初始查询。 SAM-MT用一个轻量级的"加权头"(MLP-based weighting head)把这些多个查询合并成一个单一的"目标查询":系统会自动评估每个点的重要性,给重要的点更高的权重,然后加权平均,得到一个最具代表性的单一向量。

K | 这个单一向量就是后续帧中代表这个目标的"通缉令"。 从第二帧开始,每个目标只有一个查询在流转,既简洁,又携带了最关键的身份信息。

L | 这个设计把初始帧"点多个点"的灵活性,与后续帧"单一查询"的高效性,优雅地衔接在了一起。 五、稀疏记忆:用"关键词档案"替代"全程录像带" SAM2的记忆系统非常"重":它存储的是每一帧图像的像素级特征图,一帧图像大约有4096个特征"像素点",每个点都有一套完整的特征描述。如果为每个目标单独维护这样一套记忆,随着目标数量增加,内存占用会急剧膨胀。 SAM-MT的应对方案是引入"基于查询的稀疏记忆"(Query-based Sparse Memory)。核心思路是:不再给每个目标存储完整的像素级记忆,而是只存储那个经过聚合的"目标查询"——一个目标,一帧,只有一个向量。 这个设计的压缩效率极高。用数字来说,传统方法每帧每目标需要存储4096个特征点,而SAM-MT只需要1个查询向量。这意味着同样的内存,SAM-MT可以往记忆库里存放多得多的历史帧,从而让系统"记住"更长时间跨度里目标的变化。这对于处理目标被遮挡后重新出现的场景尤为重要——记忆越长,就越不容易在目标消失一段时间后把它认错。 实验数据印证了这一点:在长序列基准测试LVOSv2和LVOSv1上,SAM-MT比SAM2.1-B+分别高出了2.0和2.3个百分点,而这两个数据集正是专门考验长时序追踪能力的。内存占用方面,追踪20个目标时,SAM2.1-B+需要8585MB显存,SAM-MT只需要3785MB,相差悬殊。 在稀疏记忆的具体组织上,SAM-MT采用先进先出(FIFO)的滑动窗口策略:始终保留第一帧的目标查询(因为那是用户初始指定的"基准形象"),以及最近T-1帧的目标查询。论文实验测试了不同窗口大小(8、12、16、32帧)的效果,最终选定16帧作为速度与精度的最佳平衡点。 六、身份变换器:确保"通缉令"随时间自动更新 目标不是静止的,它们会运动、旋转、被遮挡、改变姿态。

M | 一张在视频开头拍的"通缉令",到了视频后半段可能已经不太准确了。SAM-MT用"身份变换器"(Identity Transformer)来解决这个问题。 在每一帧处理结束后,当前帧的目标查询会被存入稀疏记忆。在处理下一帧时,身份变换器会让上一帧的目标查询,去"查阅"稀疏记忆里这个目标的所有历史查询,通过注意力机制综合参考历史信息,对当前查询进行更新和校正。这就像侦探每天下班前,会把今天观察到的新线索与历史档案对比,更新对嫌疑人最新状态的判断,让明天的追踪更精准。

N | 身份变换器同样引入了一个"身份感知掩码":每个目标的查询只能查阅自己历史档案里的记录,不能跨目标查阅,从而杜绝了历史记忆层面的"串档"风险。消融实验表明,去掉这个掩码后,J&F指标会下降3.9个百分点。此外,研究团队测试了不同深度(1层、3层、5层)的变换器,最终选择3层,以在精度和速度之间取得平衡。 七、训练策略:让模型学会应对现实的复杂性 一个好的模型框架,还需要配套合理的训练策略才能发挥出应有的潜力。SAM-MT在训练上采取了几个有针对性的设计。 训练分为两个阶段:第一阶段在静态图片上训练,确保模型能够准确地从点击信号出发,一次性完成多目标的图像分割;第二阶段在视频序列上训练,强化跨帧的身份一致性。这个"先学静态、再学动态"的课程式学习策略,让基础打得更扎实。实验表明,去掉图像预训练阶段,准确率会下降2.7个百分点。 帧采样策略也经过精心设计。

o | 传统方法通常采样相邻的连续帧,这对于应对快速运动有好处,但对于"目标消失后重新出现"这种长时间跨度的事件,相邻帧的训练几乎没有帮助。

p | SAM-MT采用"跨步采样":每次训练取8帧,其中一部分是连续帧(捕捉短期运动),另一部分是间隔4帧的跨步采样(覆盖更长的时间窗口,最多跨越32帧)。去掉跨步采样后,准确率下降1.3个百分点,而且在目标重新出现的场景中,系统会频繁认错目标。 重叠惩罚损失函数是另一个关键设计。在多目标场景中,如果两个目标的预测掩码出现重叠(即同一个像素被判定属于两个不同目标),就意味着身份出现了混乱。SAM-MT在损失函数里加入了一项专门的惩罚项:对于目标i的预测概率图,计算它与所有其他目标概率图的逐元素乘积,取平均值作为惩罚项,鼓励模型尽量输出互不重叠的掩码。

q | 这在羊群、车队等密集场景里效果尤为明显,能显著减少同一像素被多个目标"抢占"的混乱情况。 八、实验结果:数字背后的真实表现 SAM-MT在六个主流视频分割基准测试上进行了全面评估,每一个都代表了不同的真实挑战场景。 MOSEv2和MOSEv1是专门收录了频繁遮挡、快速运动、低光照、目标密集等极端场景的数据集。SAM-MT在MOSEv2上达到43.0分(J&F指标),超过了之前最好的结果Cutie的42.8分和SAM2.1-B+的41.1分。值得注意的是,SAM-MT和SAM2.1-B+都使用点击初始化,而其他方法使用的是更为"作弊"的真实标注掩码初始化,这意味着SAM-MT在更弱的初始条件下取得了更好的结果。 LVOSv2和LVOSv1是专注于长时序追踪的数据集,视频更长,目标会长时间消失后重新出现。这正是稀疏记忆设计的主场,SAM-MT的优势也最为突出:在LVOSv2上达到76.6分,比SAM2.1-B+的74.6高出2.0分;在LVOSv1上达到73.6分,比SAM2.1-B+的71.3高出2.3分。 SA-V val和SA-V test是包含大量遮挡和局部目标(如只露出头的人)的数据集,SAM-MT同样与SAM2.1-B+持平,在val上分别为66.1对65.6,在test上并列于66.4对66.1。 速度方面的对比最为直观。研究团队专门构建了一个合成基准测试,包含20个视频序列,目标数量从1个到20个分布,每个序列100帧,用来测量不同方法在不同目标密度下的帧率变化。在单目标时,SAM-MT和SAM2.1-B+的帧率相同,都是37.2帧/秒。但随着目标数量增加,SAM2.1-B+的帧率急剧下滑:3个目标时17.8帧,5个目标时12.4帧,9个目标时7.8帧,20个目标时只剩3.7帧。

r | SAM-MT的帧率曲线则近乎水平:3个目标36.8帧,9个目标36.3帧,20个目标35.4帧,几乎感受不到任何差异。 在真实的视频数据集上,这种差距同样显著。以MOSEv2数据集中包含5个以上并发目标的子集为例,SAM-MT的帧率从整体的36.9帧仅轻微下降到35.8帧,而SAM2.1-B+从32.1帧骤跌至11.5帧,Cutie(1024p分辨率)从21.3帧跌至10.2帧。 九、真实场景中的表现:密集、相似、遮挡 研究团队还做了一系列定性实验,在真实视频里直观展示了SAM-MT的效果。 在高密度场景中,包括马戏表演(多个演员持续交叉移动)、鸭群(大量外观相似的鸭子)、团体健身课(十几个动作相似的参与者),SAM-MT都能为每个指定目标维持精确、稳定的分割轮廓,不同目标的颜色标记清晰分明,几乎没有出现混淆或丢失目标的情况。 在身份模糊场景中(如多只熊猫在草地上玩耍、多辆公交车在站台前停靠、台球游戏中多个颜色相近的球),SAM2.1-B+的表现是:开始时追踪正常,但过了一段时间后,要么丢失了某个目标,要么把两个目标的身份搞混,用错误的颜色标记了目标。SAM-MT则全程保持了正确的身份标记,多只外观相近的目标始终被用不同颜色准确区分。 这背后的原理差异在于:SAM-MT通过解耦掩码注意力,让全局上下文信息在所有目标之间共享,这使得系统在做判断时,知道场景里还有其他目标存在,可以利用"这个区域已经被另一个目标占据了"这样的信息来辅助判断;而SAM2每个目标完全独立处理,对其他目标的存在一无所知,更容易被相似的干扰物迷惑。 说到底,SAM-MT做的事情并不神秘——它就是把"追踪多个目标"这个问题,从"一个接一个地串行处理"变成了"一次全部并行处理",同时通过精巧的隔离机制确保不同目标的信息互不干扰。

s | 这种思路的转变,让速度和效率的提升几乎是量级上的。 对普通人而言,这项研究意味着:未来的视频监控系统、自动驾驶视觉模块、运动分析工具,在处理密集多目标场景时,不再需要在"追踪精度"和"实时速度"之间艰难取舍。当然,SAM-MT目前仍然是纯视觉的系统,它看的懂画面,却不理解画面的语义——比如它能把一只猫精确圈出来,但它不知道这只猫正在捉弄它旁边的那只狗。研究团队也指出,将这套高效的多目标追踪框架与多模态大模型结合,是下一步值得探索的方向。 有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.08688查阅完整论文,代码也已在GitHub的FudanCVL/SAM-MT仓库开源。 --- Q&A Q1:SAM-MT追踪多个目标为什么比SAM2快这么多? A:SAM2追踪多个目标时,每新增一个目标就要完整重跑一遍记忆匹配和掩码解码,速度随目标数量线性下降。SAM-MT用轻量级"目标查询"代替了每个目标的完整像素级记忆,所有目标共享一套图像处理流程并行处理,增加目标只是多了几个查询向量,计算量几乎不变,所以追踪10个目标的速度依然能达到36帧以上。

t | Q2:SAM-MT是怎么避免追踪多个目标时把身份搞混的? A:SAM-MT设计了"解耦掩码注意力"机制:不同目标的专属查询之间被完全隔离,不能相互参考,避免了特征污染;但所有目标都可以访问代表全局场景的公共查询,保持对整体环境的感知。同时,身份变换器在更新每个目标的查询时,也严格限制每个目标只查阅自己的历史档案,从根本上切断了跨目标的"串台"路径。 Q3:SAM-MT在哪些实际场景里能用上? A:SAM-MT适合任何需要实时追踪多个物体的场景。

u | 自动驾驶需要同时追踪周围所有行人和车辆;体育分析需要实时标记场上所有球员的运动轨迹;视频监控需要持续识别多个嫌疑目标;机器人导航需要同时感知多个障碍物。这套方案在目标密集时仍能保持实时速度,正好满足这类场景对"快"和"多"的双重需求。
Current article:http://w6xm.bianneixuanbingqinyouxie.buzz/1pllm/7v9.html
Published on:16:12:14