CVPR2026 | FusionAgent:用于人体识别的动态模型选择多模态智能体

 

图片

该论文于IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR 2026)。论文题目为《FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition》。

本文第一作者为美国密歇根州立大学博士生朱杰,合作者包括该校博士生郭晓、苏一洋、Anil Jain教授、刘小明教授。

论文链接:https://openaccess.thecvf.com/content/CVPR2026/html/Zhu_FusionAgent_A_Multimodal_Agent_with_Dynamic_Model_Selection_for_Human_CVPR_2026_paper.html

图片

论文概要

针对现有多模态人体识别方法采用固定模型组合、无法根据样本质量动态调整的问题,本文提出多模态智能体框架 FusionAgent。该框架将人脸识别、步态识别和行人重识别等专用模型封装为可调用工具,利用多模态大语言模型分析每个查询样本,并根据人脸可见度、图像质量、视角和身体信息等特征,动态选择合适的模型组合。为避免穷举最优组合或依赖人工构建的工具调用数据,作者采用基于 GRPO 的强化微调策略,并设计格式奖励、工具调用成功奖励、身份预测准确率奖励和任务指标奖励,引导智能体学习样本级模型选择策略。

针对不同识别模型之间分数尺度不一致以及动态模型组合带来的分数错位问题,本文进一步提出锚点置信度 Top-k(Anchor-based Confidence Top-k,ACT)融合方法。ACT 以智能体首先选择的模型作为锚点,保留其完整分数排序,同时仅融合其他模型中经过标准化的 Top-k 高置信预测,从而降低低质量模态和非匹配候选带来的噪声。

作者在 CCVID、LTCC 和 MEVID 三个人体识别基准上进行了实验。结果表明,FusionAgent 在 mAP、验证率和开放集检索等多项指标上优于传统规则融合及学习式融合方法,尤其能够显著降低 FNIR。消融实验进一步证明,主要性能提升来源于逐样本动态模型选择,而 ACT 融合能够进一步增强开放集场景下的可靠性。总体而言,该研究将多模态大模型从直接识别器转变为专用模型的智能调度器,为准确、高效且具有一定可解释性的多模型视觉系统提供了新的解决思路。

研究背景

在复杂、非受控环境中,仅依赖单一生物特征往往难以实现稳定的人体识别。人脸、步态、身体形状和服装外观等信息具有明显的互补性:清晰正脸适合人脸识别,远距离或背身视频可能更依赖步态和身体特征,而换装、遮挡、低分辨率及极端视角又会降低部分模态的可靠性。因此,融合多种生物特征和多个专用模型,已成为提升全身人体识别性能的重要途径。

现有方法主要在分数层面对不同模型的预测结果进行融合,包括 Z-score、Min-max、加权求和等规则方法,以及通过训练数据学习融合权重的方法。然而,这些方法通常为所有测试样本调用相同的模型,并采用固定的融合策略,默认不同模型始终能够提供有效的互补信息。该假设在实际场景中并不成立。例如,当视频中只出现人物背影时,人脸识别模型不仅难以提供有效信息,还可能将噪声引入最终结果;无差别调用全部模型也会造成额外的计算开销。

近年来,多模态大语言模型在视觉理解、推理和工具调用方面展现出较强能力,使其能够根据输入内容选择并调度不同的专业模型。与此同时,强化微调可以在缺少标准工具调用轨迹的情况下,利用最终任务表现训练智能体的决策策略。基于这一发展,本文关注的核心问题是:能否利用多模态智能体,根据每个样本的视觉条件动态选择最合适的识别模型,并对异构模型的输出进行可靠融合? FusionAgent 正是针对这一问题提出的样本级动态模型选择与分数融合框架。

研究方法

IMG_256

图1 FusionAgent总体框架

如图1所示,FusionAgent主要由动态模型选择智能体、专业人体识别工具池和ACT分数融合模块组成。对于输入的查询视频,MLLM智能体首先分析人物特征和样本质量,再以多轮交互的方式调用人脸、步态或行人重识别模型,并根据工具返回的身份预测决定是否继续调用其他模型。模型生成的相似度向量由系统保留,完成模型选择后交由ACT模块融合,得到最终身份预测。训练阶段采用基于GRPO的强化微调,并通过多种奖励优化模型选择策略。

(一)专业模型工具化与动态选择

FusionAgent不直接替代现有的人体识别模型,而是将人脸识别(FR)、步态识别(GR)和行人重识别(ReID)模型封装为外部工具。其中,人脸模型适用于面部清晰的样本,步态模型主要提取人物运动特征,ReID模型则利用身体外观、服装和形状信息进行身份匹配。

设专业模型工具集合为:

(1)

对于查询样本 q 和注册身份库G,每个模型 m 都会生成相似度向量:

(2)

其中,每个元素表示查询样本与一个注册身份之间的相似度。

针对不同查询样本,FusionAgent动态选择模型子集:

(3)

MLLM智能体首先分析视频中的人脸可见度、图像质量、拍摄视角和身体信息,再通过ReAct式多轮交互选择并调用专业模型。工具调用后,预测身份返回给智能体,完整相似度向量则保存在系统内部。智能体根据视频内容和已有预测结果,决定继续调用其他模型或结束推理。

例如,当人物面部清晰时,智能体可以优先调用人脸识别模型,并根据结果决定是否增加ReID模型;对于背身、低分辨率或面部遮挡的样本,则可以跳过人脸模型,优先选择步态或ReID模型。相比一次性确定全部模型,多轮选择能够将复杂的组合搜索拆分为连续的简单决策,并根据前一次工具结果动态调整后续调用。

智能体选择的第一个模型同时作为ACT融合的锚点。因此,MLLM不仅决定使用哪些模型,还通过模型调用顺序影响最终的分数融合结果。

(二)基于GRPO的强化微调

为每个样本穷举全部模型组合并标注最优选择,需要极高的计算成本;同时,研究中也不存在现成的“样本分析—工具调用—最终回答”监督对话数据。为此,作者使用GRPO对智能体进行强化微调,使其通过多次尝试学习有效的工具调用策略。

对于同一个查询样本,GRPO从当前策略中采样多条模型调用轨迹,并根据各轨迹的奖励计算相对优势。表现较好的工具组合会获得更高奖励,从而提升其在后续训练中被选择的概率。

论文设计了四类奖励:

1.格式奖励:格式奖励用于约束智能体生成结构化输出,使推理内容、工具调用和最终回答能够被系统正确解析。例如,每轮输出需要按照规定格式区分分析过程、工具参数和最终身份预测。

2.工具调用成功奖励:该奖励判断工具名称、输入参数和调用格式是否正确。如果模型名称不存在、JSON格式错误或调用无法执行,则不会获得工具成功奖励。其作用是让智能体首先学会稳定、合法地使用外部识别模型。

3.身份预测准确率奖励:身份准确率奖励直接比较智能体最终输出身份ai与真实身份 y:

(4)

这一奖励保证智能体不会只追求正确的工具调用过程,而忽略最终人体识别结果。

4.指标奖励:仅使用单样本身份准确率,难以反映验证和开放集检索性能。因此,作者进一步设计任务指标奖励,将模型组合在训练集上的整体识别表现作为反馈:

(5)

该奖励同时鼓励智能体提高Rank-1、mAP和TAR,并降低FNIR,使模型选择策略与实际人体识别系统的评价指标直接对齐。

由于每条轨迹只包含当前样本的模型选择,而TAR和FNIR等指标需要在数据集层面计算,作者构建了增强模型选择矩阵:一部分样本保留智能体真实选择的模型组合,其余样本通过伯努利分布随机采样模型组合,同时始终保留锚点模型。随后使用ACT融合所有样本的分数,并计算数据集级指标奖励。这种方式在避免穷举搜索的同时,扩大了模型组合的探索范围。

(三)ACT动态分数融合

不同人体识别模型的分数尺度、分布和嵌入空间存在明显差异。同时,FusionAgent为不同样本选择的模型数量和组合也不相同,因此不能直接对分数进行简单求和或平均。

为解决这一问题,作者提出Anchor-based Confidence Top-k(ACT)分数融合方法,如图2所示。

IMG_256

图2 ACT分数融合

智能体首先选择的模型 ma 被设为锚点。ACT完整保留锚点模型的相似度向量,使其为全部候选身份提供稳定的全局排序结构。

锚点通常是智能体根据当前样本特征判断后最可靠的模型。例如,清晰正脸样本可能以人脸模型为锚点,而监控场景中的低质量侧身视频可能以ReID模型为锚点。由于不同模型的输出范围不同,ACT首先使用Z-score对各模型分数进行标准化:

(6)

其中,sm,q,g表示模型m对查询样本q与注册身份g的相似度;μm,q和σm,q 分别表示该模型分数向量的均值和标准差。

对于锚点以外的模型,ACT只保留其得分最高的Top-k个候选身份:

(7)

其中,Tm,q 表示模型m的Top-k候选集合。这种稀疏融合方式使辅助模型只在自身最有把握的候选身份上提供修正,避免大量低置信度非匹配分数干扰最终结果。最终融合分数由锚点模型的完整分数和其他模型的Top-k贡献共同组成:

(8)

其中,锚点模型负责维持全局排序,其他模型负责提供局部、高置信度的补充证据。经过归一化后,系统得到最终身份分数向量,并选择得分最高的身份作为预测结果。

总体而言,FusionAgent负责回答“当前样本应该使用哪些模型”,ACT负责解决“这些动态选择的异构模型应该如何融合”。两者共同构成了论文提出的样本级动态人体识别框架。

实验结果

论文在CCVID、LTCC和MEVID三个公开人体识别数据集上进行了验证。CCVID和MEVID为视频数据集,LTCC为图像数据集,均包含不同程度的视角变化、低质量人脸、服装变化和复杂监控环境,用于评估模型在多模态全身人体识别任务中的表现。

实验采用Rank-1准确率、平均精度均值(mAP)、真实接受率(TAR@1%FAR)和错误非身份识别率(FNIR@1%FPIR)作为评价指标。其中,Rank-1、mAP和TAR越高越好,FNIR越低越好。开放集实验随机构建10个非匹配身份子集,每个子集包含约20%的测试身份,FNIR报告10次实验的均值和标准差。

三个数据集上的识别性能

如表1所示,分别展示了FusionAgen在三个数据集上的识别性能

表1 FusionAgent与不同单模型及分数融合方法在CCVID、LTCC和MEVID数据集上的性能比较(从左至右依次为CCVID、LTCC和MEVID)

在CCVID数据集上,FusionAgent-CoT取得93.4%的Rank-1、92.6%的mAP、85.9%的TAR和10.1%的FNIR。与QME相比,其mAP由90.8%提升至92.6%,TAR由76.2%提升至85.9%,FNIR由12.3%降低至10.1%。不过,FusionAgent-CoT的Rank-1略低于QME的94.1%。这表明FusionAgent在CCVID上的优势主要体现在验证和开放集检索性能,而不是所有指标均达到最高水平。

在LTCC数据集上,FusionAgent取得了最稳定的整体提升。FusionAgent-CoT的Rank-1、mAP和TAR分别达到75.5%、41.0%和37.0%,高于QME的73.8%、39.6%和35.0%。与此同时,FNIR由QME的64.3%显著降低至50.0%。LTCC包含明显的服装变化和长期外观变化,人脸质量也相对较低。在这种情况下,固定使用人脸、身体和外观模型容易引入不可靠信息,而FusionAgent能够根据样本条件选择更加合适的模型组合,因此在开放集检索指标上获得了较大提升。

在MEVID数据集上,FusionAgent-CoT取得54.7%的Rank-1、28.7%的mAP、34.9%的TAR和58.6%的FNIR。与QME相比,其mAP和TAR分别提高0.5和2.0个百分点,FNIR降低6.0个百分点。但FusionAgent-CoT的Rank-1为54.7%,低于QME的55.7%。因此,FusionAgent并非在每个数据集的所有指标上都取得最优结果,其优势主要集中在多模型融合质量、验证性能和开放集错误控制方面。

总体来看,FusionAgent在三个数据集上均显著降低了FNIR,并在多数mAP和TAR指标上超过传统规则融合与学习式融合方法。Rank-1的提升相对有限,这是因为Rank-1通常主要由最强的单一模态决定,而FNIR对非匹配分数和异常样本更加敏感,更能体现动态选择与ACT融合的优势。

(二)推理效率与跨域性能

FusionAgent提供Direct Answering(DA)和Chain-of-Thought(CoT)两种推理模式。DA模式不输出显式推理过程,平均推理时间约为1.03秒;CoT模式会展示样本分析和模型选择理由,平均推理时间约为2.81秒。作为对照,QME的平均推理时间约为0.67秒。DA模式的速度明显快于CoT,同时保持相近的识别性能。例如在LTCC上,两种模式的Rank-1和mAP均为75.5%和41.0%,FNIR分别为50.3%和50.0%。因此,实际部署时可以根据应用需求在推理速度和可解释性之间进行选择。论文还在LTCC上进行了跨域实验,如表2所示。当FusionAgent在CCVID上训练、直接迁移到LTCC时,ACT在零样本设置下取得60.4%的Rank-1、11.9%的mAP、7.7%的TAR和60.3%的FNIR。与FarSight融合相比,ACT的Rank-1、mAP和TAR较低,但FNIR由81.8%降低至60.3%。使用每个身份10个目标域样本并微调50步后,Rank-1提升至73.6%,mAP提升至39.8%,说明少量目标域数据能够显著改善智能体的模型选择能力。在MEVID迁移至LTCC的零样本实验中,ACT与FarSight均取得75.3%的Rank-1。ACT的mAP和TAR略低,但FNIR由59.3%降低至50.1%,再次表明ACT更擅长控制开放集错误。

表2 FusionAgent在LTCC数据集上的跨域性能比较

跨域实验说明,FusionAgent能够适应变化后的模型工具池,但仍会受到数据分布和模型可靠性变化的影响。尤其是在新数据域中,如果智能体选择了不可靠的锚点模型,ACT保留的全局排序可能放大预测错误。因此,当前方法尚未完全解决跨域条件下的模型可靠性估计问题。

(三)消融实验与智能体行为分析

论文首先比较了Agent动态选择与固定使用全部模型的硬选择策略。如图3所示,在不同Top-k设置下,Agent选择在Rank-1、mAP和TAR上整体优于硬选择,并表现出更高的稳定性。硬选择会将所有可用模型的结果直接用于融合。当部分模型与当前样本不匹配时,其输出会干扰最终分数。FusionAgent则能够跳过低质量或缺少有效信息的模态,从而减少冗余模型带来的噪声。

图3 LTCC数据集上的动态模型选择与固定模型选择比较

论文还将Agent选择的模型组合分别交给Z-score、FarSight和ACT进行融合。与QME相比,Agent+Z-score的Rank-1由73.8%提升至74.8%,mAP由39.6%提升至41.7%;Agent+FarSight同样取得74.8%的Rank-1和41.7%的mAP。这说明即使不使用ACT,只要采用Agent进行动态模型选择,普通分数融合方法也可以超过QME,证明性能提升首先来自样本级模型选择。ACT取得最高的75.5% Rank-1,并将FNIR降低至51.0%。不过,其mAP和TAR略低于Agent+Z-score及Agent+FarSight。因此,更准确的结论是:动态模型选择决定了主要性能增益,ACT则进一步改善了Rank-1和开放集FNIR。

同数据集上的模型选择统计进一步展示了FusionAgent学到的策略,如图4所示。在人脸较清晰的CCVID中,Agent主要选择AdaFace+CAL,并经常将人脸模型AdaFace作为锚点;在MEVID中,Agent主要选择CAL+AGRL;在包含长期服装变化和低质量人脸的LTCC中,则主要选择AIM+CAL。这表明Agent会根据不同数据集和查询样本的视觉特征调整模型组合:人脸信息可靠时优先使用人脸模型,监控视角或低质量人脸场景下则更加依赖身体与ReID模型。

作者还在LTCC上通过数据集级网格搜索寻找最佳固定模型组合。结果显示,AIM+CAL是表现最好的固定组合,取得74.8%的Rank-1、41.0%的mAP、36.1%的TAR和53.4%的FNIR。FusionAgent的模型选择结果与该组合高度一致,但凭借逐样本调整能力,进一步将Rank-1提升至75.5%,并将FNIR降低至51.0%。这说明Agent不仅能够发现总体上有效的模型组合,还能利用不同样本之间的差异进行更细粒度的调整。

图4 FusionAgent在不同数据集上的模型选择统计

结论

本文提出FusionAgent,一种面向全身人体识别的多模态智能体框架。该方法将人脸识别、步态识别和行人重识别模型封装为外部工具,利用多模态大语言模型分析不同查询样本,并动态选择合适的模型组合。为解决异构模型输出分布不一致及动态模型组合带来的分数错位问题,论文进一步提出ACT融合方法,以锚点模型维持全局排序,并利用其他模型的Top-k高置信度结果进行局部修正。

在CCVID、LTCC和MEVID三个公开数据集上的实验表明,FusionAgent在多数mAP、TAR和FNIR指标上优于现有分数融合方法,尤其能够显著降低开放集检索中的错误非身份识别率。消融实验进一步说明,主要性能提升来自样本级动态模型选择,而ACT能够进一步增强融合结果的稳定性。DA和CoT两种模式还为推理效率与可解释性提供了不同选择。

——END——

撰稿人:叶芃

审核人:周成菊

图片

脑机接口与混合智能研究团队


登录用户可以查看和发表评论, 请前往  登录 或  注册
SCHOLAT.com 学者网
免责声明 | 关于我们 | 用户反馈
联系我们: