0
点赞
0
评论
0
转载
我要入驻

论文聚焦|EMNLP’26 × 3|从记忆到调用,从观察到因果,从判断到自适应——探索智能的转化边界

收录于合集: # 快讯

日前,实验室博士生王伟杭吴家云刘官明分别作为第一作者的三篇论文“VIRA-Bench: Diagnosing Pedagogical Contingency Understanding in Online Tutoring Videos”(Main Conference)、“Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models”(Main Conference)和“StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance”(Findings)被 The 2026 Conference on Empirical Methods in Natural Language Processing(EMNLP 2026)录用。

 

当AI在识别、记忆、判断等单项能力上不断突破,一个更根本的瓶颈逐渐浮现:智能的关键瓶颈,往往不在感知本身,而在感知之后的转化——从观察到使用、从记忆到行动、从判断到决策。这三篇工作,从长时记忆调用、交互因果推理、自适应奖励判断三个维度,共同揭示了这一深层挑战。记忆系统能记住过往,却未必能在未来需要时将其唤醒(StreamMemBench);模型能看见动作,却未必能读懂动作背后的因果链条(VIRA-Bench);奖励模型能给出判断,却未必知道何时该信任直觉、何时该深入反思(F/S-RM)。记忆与调用之间、观察与因果之间、判断与自适应之间,横亘着认知转化的鸿沟。这三篇工作深刻审视了这些问题,并创新探索以更符合认知规律的方式弥合它们——让记忆从被动记忆转向主动调用,让理解从表面时序转向深层因果,让判断从单一模式转向自适应切换。这些研究启示我们,智能的本质不是拥有更多信息,而是知道如何恰当地使用信息。从感知到转化,AI正迈入一个更接近人类认知运作方式的新阶段。

 

会议简介

图片

The Conference on Empirical Methods in Natural Language Processing(EMNLP)是自然语言处理与计算语言学领域具有重要国际影响力的学术会议,由国际计算语言学协会(ACL)旗下 SIGDAT 组织,研究主题涵盖语言模型、多模态理解、文本生成、信息抽取、问答系统、机器翻译及大模型评测等方向。EMNLP 2026 将于 2026 年 10 月 24 日至 29 日在匈牙利布达佩斯举行。

 

论文简介

 

1 VIRA-Bench: Diagnosing Pedagogical Contingency Understanding in Online Tutoring Videos

图片

论文作者: Weihang Wang, Hansu Gu, Guanming Liu, Peng Zhang, Ning Gu, Tun Lu

 

论文简介: 理解教学视频中的互动过程,需要模型识别教师行为、学生回应与后续调整之间的联系,现有视频理解基准对这一能力的考察仍然不足。为此,我们提出 VIRA-Bench,一个面向在线辅导视频的教学互动理解基准,包含 1,005 段一对一辅导视频和 1,322 道经过多阶段质量检查的多项选择题。该基准从关键行为与内容识别、师生动作联系理解,以及教学支持与学生理解程度的匹配三个方面开展评测,从而区分模型在事件感知和互动理解上的不同困难。我们系统评测了 11 个不同规模的商业及开源多模态模型,结果表明,最佳模型的整体准确率为 61.3%,明显低于 91.0% 的人类参考水平,其中,对教师动作、学生回应和后续调整之间联系的理解是当前模型最薄弱的能力。消融实验进一步发现,移除视频对关键行为识别的影响最大,而打乱事件顺序则主要影响前后互动的理解。VIRA-Bench 为诊断多模态模型的教学互动理解能力提供了评测基础,并为多模态视频理解和教育智能研究提供了新的方向。

 

图1 VIRA-Bench 教学互动理解与分层诊断

 

2 Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

图片

论文作者: Jiayun Wu, Peng Zhang, Yuanyuan Lu, Shan Qu, Ning Gu, Tun Lu

 

论文简介: 在内容审核、客服评测等业务场景中,LLM-as-a-Judge 正逐渐成为一种重要的自动化判断范式。实际应用中,不同样本的判断难度差异很大:大量简单样本可以快速完成决策,而复杂、模糊或低置信度样本往往需要更充分的推理。如何让模型根据样本难度动态选择判断方式,在保证准确率的同时降低推理成本,是这类系统面临的重要问题。为此,我们提出快慢思维奖励模型 F/S-RM,在同一个模型中融合快速评分与深入分析两种模式,分别通过首 Token 预测完成快速判断,通过思维链进行深入推理。在推理阶段,F/S-RM 利用双置信度激活机制评估当前样本的不确定性,仅在快速判断不够可靠时启动慢思维推理,从而将计算资源更多地分配给复杂样本。实验结果表明,F/S-RM 在混合推理模式下于多项基准上取得平均 84.3 的成绩,同时将 Token 消耗降低 22.5%,为内容审核、客服评测等场景中的自动化判断提供了一种兼顾效果与效率的技术思路。

 

图2 F/S-RM 快慢思维机制与训练流程

 

3 StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

图片

论文作者: Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun Lu

 

论文简介: 个人智能体的长期记忆需要将日常观察和交互反馈转化为对未来任务的帮助,但现有记忆基准通常将事实回忆与任务改进分开测试,难以追踪信息从观察、使用、修正到后续复用的完整过程。为此,我们提出 StreamMemBench,一个面向未来协助的流式记忆评测基准。该基准以从 EgoLife 第一视角生活流中提取的证据锚点为基础,围绕同一条证据信息构建前后相连的两项任务:初始任务检验系统能否调用观察证据,后续任务检验其能否将模拟用户的反馈和交互经验迁移到未来相似情境。同时,基准通过证据回忆、初始证据使用、反馈吸收和后续复用四项指标,对记忆过程进行分阶段诊断。我们在三种基础模型上评测了八种代表性记忆方案,结果表明,已记住的证据未必能够被正确使用,而反馈对当前回答的改善也未必能够转化为稳定的未来行为。StreamMemBench 将智能体记忆的评测重点从事实回忆推进到经验的持续使用,为个人助理和长期交互智能体研究提供了更贴近真实使用过程的评测基础。

 

图片

图3 StreamMemBench 基准构建与流式记忆评测流程

 

 

如果您对本文内容感兴趣,可与通讯作者联系: zhangpeng_@fudan.edu.cn

 

实验室相关论文

 

[1] Weihang Wang, Hansu Gu, Guanming Liu, Peng Zhang, Ning Gu, Tun Lu. VIRA-Bench: Diagnosing Pedagogical Contingency Understanding in Online Tutoring Videos. EMNLP 2026, Main Conference.

[2] Jiayun Wu, Peng Zhang, Yuanyuan Lu, Shan Qu, Ning Gu, Tun Lu. Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models. EMNLP 2026, Main Conference.

[3] Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun Lu. StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance. EMNLP 2026, Findings.

[4] Wenxin Zhao, Peng Zhang, Hansu Gu, Haoxuan Zhou, Xiaojie Huo, Lin Wang, Wen Zheng, Tun Lu, Ning Gu. SparkTales: Facilitating Cross-Language Collaborative Storytelling through Coordinator-AI Collaboration. CHI 2026.

[5] Jiahao Liu, Shengkang Gu, Dongsheng Li, Guangping Zhang, Mingzhe Han, Hansu Gu, Peng Zhang, Tun Lu, Li Shang, Ning Gu. AgentCF++: Memory-enhanced LLM-based Agents for Popularity-aware Cross-domain Recommendations. SIGIR 2025.

[6] Yubo Shu, Hansu Gu, Peng Zhang, Tun Lu, Ning Gu. An Intent-based and Annotation-free Method for Duplicate Question Detection in CQA Forums. EMNLP 2023.

 

 

如果您对我们实验室的相关工作感兴趣,欢迎访问我们的网站:

协同信息与系统实验室(CISL)

实验室网站主页

https://cscw.fudan.edu.cn/

实验室Github主页

https://github.com/FudanCISL

学者网机构号是学者网提供的学术"公众号"平台,为学者团队、学术机构、企业等提供官方媒体账号服务,支持发布动态、活动、通知与招生招聘信息等内容,支持多人协作维护,助力机构链接学界资源、扩大学术影响力。

返回顶部