论文库

研究分类

我读过的论文个人库。

3 个研究方向 83 篇结构化笔记
01 空间智能与世界模型

三维感知与 BEV

83 篇结构化笔记
01

BEVFormer:基于时空 Transformer 从多相机图像学习鸟瞰图表示

Zhiqi Li, Wenhai Wang, Hongyang Li et al. ECCV 2022 2022

主题
标签
BEV Query空间交叉注意力时序融合

BEVFormer 将标定后的多相机系统转化为持续更新的 BEV query 空间,以几何感知的空间注意力和递归时序融合替代显式深度提升。

02

MonoScene:单目三维语义场景补全

Anh-Quan Cao and Raoul de Charette CVPR 2022 2022

主题
标签
单目 SSCFLoSP三维上下文先验

MonoScene 证明单张 RGB 图像也能推断密集三维几何与语义:关键是用视线特征投影连接二维编码器和三维补全网络,并加入上下文感知监督。

03

TPVFormer:用于视觉三维语义占用预测的三平面视角表示

Yuanhui Huang, Wenzhao Zheng, Yunpeng Zhang et al. CVPR 2023 2023

主题
标签
三平面表示稀疏监督跨视角注意力

TPVFormer 将 BEV 扩展为三个正交特征平面,以接近二维而非三维立方级的表示成本保留高度感知的三维结构。

04

OccFormer:面向视觉三维语义占用预测的双路径 Transformer

Yunpeng Zhang, Zheng Zhu, and Dalong Du ICCV 2023 2023

主题
标签
双路径 Transformer类别 Query类别引导采样

OccFormer 将三维注意力分解为局部水平结构与池化的全局场景路径,使密集 voxel 推理更可控,并把 mask-classification decoder 适配到稀疏、类别不平衡的占用标签。

05

OccWorld:面向自动驾驶的三维占用世界模型

Wenzhao Zheng, Weiliang Chen, Yuanhui Huang et al. ECCV 2024 2024

主题
标签
离散场景 Token自回归预测自车-场景联合建模

OccWorld 将语义占用作为生成式驾驶世界模型的状态,把历史三维场景 token 化,并自回归预测未来占用与自车运动。

06

Where2comm:基于空间置信图的通信高效协同感知

Yue Hu, Shaoheng Fang, Zixing Lei et al. NeurIPS 2022 2022

主题
标签
空间置信度带宽自适应多轮融合

Where2comm 将协同感知从全图广播变成空间选择性交换:智能体只传输置信度选中的区域,并在多轮通信中请求互补证据。

07

面向网联自动车的混合特征融合协同语义占用预测

Rui Song, Chenwei Liang, Hu Cao et al. CVPR 2024 2024

主题
标签
协同占用混合任务融合正交平面特征

CoHFF 将 camera-based 协作从目标框和 BEV 地图扩展到密集语义占用:车内融合 occupancy 与 semantic task feature,车间交换压缩正交平面特征。

08

Token Merging: Your ViT But Faster (ToMe)

Daniel Bolya et al. ICLR 2023 Oral 2023

主题
标签
免训练二分图匹配通用方法

Training-free token merging 的经典起点:它把冗余理解为信息压缩问题,而不是简单的 token 删除问题。

09

ALGM:面向 Plain ViT 语义分割的自适应先局部后全局 Token Merging

Narges Norouzi, Svetlana Orlova, Daan de Geus, Gijs Dubbelman CVPR 2024 2024

主题
标签
密集预测先局部后全局自适应合并

一篇面向 dense prediction 的 token merging 论文;核心启发是 token similarity 具有层深依赖性:浅层适合局部合并,深层才适合全局语义合并。

10

PiToMe:通过保持谱结构的 Token Merging 加速 Transformer

Hoai-Chau Tran et al. NeurIPS 2024 2024

主题
标签
重要性保护图能量谱结构保持

PiToMe 在相似度匹配之前加入重要性感知筛选:冗余簇可以被压缩,而孤立、独特的 token 应被保护。

11

ATC:凝聚式 Token 聚类

Joakim Bruslund Haurum et al. ECCV 2024 2024

主题
标签
凝聚式聚类低保留率密集任务

ATC 将 token merging 重写为自底向上的层次聚类,通过逐步形成连贯 cluster,替代一次性的二分图配对。

12

ToFu:连接 Token Pruning 与 Token Merging

Minchul Kim et al. WACV 2024 2024

主题
标签
剪枝与合并MLERP特征分布

ToFu 认为 pruning 与 merging 适用于不同特征阶段,并提出 MLERP 缓解普通平均合并造成的 feature-norm shift。

13

DSM:通过延迟式空间合并实现免训练 ViT 加速

Jung Hwan Heo et al. ICML 2024 ES-FoMo Workshop 2024

主题
标签
延迟合并空间局部性层级调度

DSM 说明 merging 应等待 attention 进入 convergent 阶段,再随着表示语义化,从局部窗口逐步扩展到全局匹配。

14

ToSA:具备空间感知的 Token Merging

Hsiang-Wei Huang et al. IROS 2025 2025

主题
标签
空间感知RGB-D多模态

ToSA 将语义相似度与来自 depth 的显式三维空间相似度融合,为视觉特征尚弱的 ViT 早期层提供几何信号。

15

MPM:面向高效 Vision Transformer 的互选配对合并

Simon Ravé, Pejman Rasti, and David Rousseau CVPR 2026 Findings 2026

主题
标签
互选匹配密集重建硬件时延

MPM 只在两个 token 互为最近邻时接受合并,并记录可组合 merge map,在不修改 segmentation decoder 的前提下重建密集空间特征。

16

CacheBlend:通过缓存知识融合加速 RAG 大模型服务

Jiayi Yao et al. EuroSys 2025 2025

主题
标签
RAG 服务非前缀 KV 复用选择性重计算

CacheBlend 通过选择性修复在新上下文中失真的 token,使 RAG 能真正复用文档 KV cache。

18

迈向 Streaming Attention 的紧空间复杂度界

Justin Y. Chen et al. 预印本 2026

主题
标签
流式注意力空间复杂度Coreset

该论文为流式近似 softmax attention 给出近乎紧的内存界,并澄清何时理论上可以使用次线性 KV-cache 表示。

20

E²LoRA:基于熵引导自适应共享的高效低秩适配

Minglei Li et al. ICLR 2026 Poster 2026

主题
标签
LoRA 共享Proxy Entropy自适应 Rank

E²LoRA 只在局部相似层之间共享 adapter,并依据层的信息量分配 rank,从而减少参数冗余。

21

FedLEASE:面向联邦微调的自适应 LoRA 专家分配与选择

Lei Wang et al. NeurIPS 2025 2025

主题
标签
联邦 LoRA客户端聚类自适应 MoE

FedLEASE 联合学习异质联邦环境需要多少 LoRA expert、哪些客户端共同训练它们,以及每个客户端应使用多少 expert。

23

面向大语言模型的异质可定制个性化联邦微调方法

Xin Tong and Baojiang Cui ICML 2026 Poster 2026

主题
标签
个性化联邦学习LoRA 解耦异质 Rank

Het-CPFLoRA 允许客户端选择不同个性化容量,同时保留共享的通用 LoRA 子空间。

25

Efficient Agents:在降低成本的同时构建有效智能体

Ningning Wang et al. 预印本 2025

主题
标签
成本感知智能体推理效率智能体设计

有效的智能体设计是模型选择、推理策略、工具编排和提示上下文的联合优化问题,而不是单一模型精度竞赛。

26

ParaVT:面向高效多智能体视觉推理的并行视觉工具调用

Zuhao Yang et al. 预印本 2026

主题
标签
视觉智能体并行工具调用多智能体推理

ParaVT 用协同并行调用替代串行视觉工具执行,使工具多样性带来收益,同时避免承担完整长链延迟。

27

Beyond Accuracy:揭示工具集成推理中的低效模式

Qisheng Su et al. ACL 2026 长文 2026

主题
标签
过程效率工具推理评测

两个智能体可能得到相同答案,却在无效调用、冗余验证、工具选择与格式稳定性上差异巨大;精度无法揭示这些差别。

29

ContextBudget:面向 LLM 智能体的高效上下文分配

Yong Wu et al. 预印本 2026

主题
标签
上下文分配预算感知控制智能体强化学习

ContextBudget 把上下文长度视为序列资源分配决策,把 token 用在真正提高任务成功率的步骤,而不是让每一步共享固定窗口。

31

FederatedSkill:面向智能体技能演化的联邦学习

Jingbo Yang et al. 预印本 2026

主题
标签
技能演化联邦智能体个性化

FederatedSkill 传输语义 skill diff 而非原始轨迹,并通过服务器端 capability memory 为每个客户端演化不同技能库。

32

Autogenesis:一种自演化智能体协议

Wentao Zhang et al. 预印本 2026

主题
标签
自演化智能体协议版本化资源

Autogenesis 将 prompt、agent、tool、environment 与 memory 变成显式版本化资源,再通过可审计的 propose-verify-commit 操作管理其演化。

33

智能体技能评估与演化:框架与基准

Kexin Ding et al. 预印本 2026

主题
标签
智能体技能技能演化评测基准

智能体技能是可复用程序包,其质量需要贯穿创建、检索、执行、演化与安全进行评估,而不能只看下游成功率。

34

通过结构化模板注入自动劫持智能体

Xinhao Deng et al. 预印本 2026

主题
标签
智能体劫持提示注入结构攻击

Phantom 攻击智能体上下文的序列化角色结构,而不只依赖有诱导性的恶意文本,揭示可信指令与检索数据之间的边界失效。

35

GateBreaker:门控引导的混合专家大模型攻击

Lichao Wu et al. USENIX Security 2026 2026

主题
标签
混合专家安全对齐推理时攻击

MoE 安全行为可能集中在少量被路由的 expert 与 neuron 中,形成汇总对齐评测容易隐藏的架构特定失败模式。

36

LLM 智能体的冷启动安全差距

Chung-En Sun, Linbo Liu, and Tsui-Wei Weng 预印本 2026

主题
标签
对话深度工具安全SODA Benchmark

工具调用智能体在会话开始时最不安全,经过普通前置任务后会更安全,说明安全性依赖对话状态而不只依赖当前请求。

37

PolicyShiftGuard:评测并改进策略自适应图像护栏

Mingyang Song et al. 预印本 2026

主题
标签
安全护栏策略适应多模态安全

图像安全是视觉证据与当前策略之间的关系;有效护栏必须在图像不变而策略变化时正确翻转决策。

38

面向协同感知的率失真优化通信

Genjia Liu, Anning Hu, Yue Hu et al. Preprint 2025

主题
标签
率失真离散编码消息选择

RDComm 为协同感知建立信息论目标:紧凑编码任务相关特征,只传输具有互补性的消息。

39

UniRefiner:通过对比 Register 教会预训练 ViT 自主清除无效 Token

Congpei Qiu, Zhaoyu Hu, Wei Ke et al. Preprint 2026

主题
标签
伪 Token对比 Register免训练推理

UniRefiner 诊断预训练 ViT 中的伪视觉 token,并把学习到的 register 监督转化为冻结模型可插拔的 token 过滤器。

40

CoST:统一时空视角下的高效协同感知

Zongheng Tang, Yi Liu, Yifan Sun et al. Preprint 2025

主题
标签
时空融合记忆库MADA

CoST 用同一套特征检索机制统一时序记忆与多智能体通信,而不是搭建两套独立融合模块。

41

CaDDN:用于单目三维目标检测的类别化深度分布网络

Cody Reading, Ali Harakeh, Julia Chae, Steven L. Waslander CVPR 2021 2021

主题
标签
单目三维检测类别深度特征提升

CaDDN 将单目深度不确定性保留为类别分布,并据此把图像特征提升到度量三维体积。

42

Depth Anything:释放大规模无标注数据的潜力

Lihe Yang, Bingyi Kang, Zilong Huang et al. CVPR 2024 2024

主题
标签
单目深度无标注数据教师学生

Depth Anything 说明无需复杂深度专用架构,数据规模、伪标签质量与语义保持就能构建稳健的零样本深度先验。

43

Depth Anything V2

Lihe Yang, Bingyi Kang, Zilong Huang et al. NeurIPS 2024 2024

主题
标签
合成数据 Teacher伪标签度量深度

Depth Anything V2 用精确合成监督训练巨型 teacher,再以多样真实图像蒸馏 student,将几何精度与视觉覆盖分开解决。

44

Depth Anything 3:从任意视图恢复视觉空间

Haotong Lin, Sili Chen, Jun Hao Liew et al. Preprint 2025

主题
标签
多视图几何Depth-Ray单一 Transformer

Depth Anything 3 将多视图几何简化为单一 Transformer 与统一 depth-ray 目标,同时表示场景结构与相机运动。

45

Marigold-DC:基于引导扩散的零样本单目深度补全

Massimiliano Viola, Kevin Qu, Nando Metzger et al. ICCV 2025 2025

主题
标签
深度补全引导扩散测试时优化

Marigold-DC 把稀疏测量作为预训练生成式深度先验的测试时引导,无需任务专用训练即可零样本补全。

46

VGGT:视觉几何基础 Transformer

Jianyuan Wang, Minghao Chen, Nikita Karaev et al. CVPR 2025 Best Paper 2025

主题
标签
Feed-Forward 几何多视图相机估计

VGGT 在一次 feed-forward 中为多图预测 camera、depth、point map 与 track,让 Transformer 本身成为几何引擎。

47

MCOP:多无人机协同占用预测

Zefu Lin, Wenbo Chen, Xiaojuan Jin et al. Preprint 2025

主题
标签
多无人机协同占用特征压缩

MCOP 将协同占用从道路车辆推进到无人机集群,并联合完成消息压缩、有效区域请求与共享空中场景解码。

49

PETR:面向多视图三维目标检测的位置编码变换

Yingfei Liu, Tiancai Wang, Xiangyu Zhang, Jian Sun ECCV 2022 2022

主题
标签
三维位置编码Object Query多视图检测

PETR 将相机感知三维坐标直接注入图像特征,使 object query 无需先构建密集 BEV grid 就能进行三维推理。

50

ODG:基于双 Gaussian 的占用预测

Yunxiao Shi, Yinhao Zhu, Shizhong Han et al. NeurIPS 2025 2025

主题
标签
双 Gaussian静动态分解渲染监督

ODG 为静态结构与运动目标分配不同 Gaussian query,并通过分层解码与渲染监督实现高效密集占用。

52

COME:为占用世界模型加入场景中心预测控制

Yining Shi, Kun Jiang, Qiang Meng et al. Preprint 2025

主题
标签
占用预测场景中心控制自车运动解耦

COME 将场景演化与自车视角变化解耦,并把场景中心预测作为 ControlNet guidance 注入生成式 occupancy world model。

53

COTR:用于视觉三维占用预测的紧凑 Occupancy Transformer

Qihang Ma, Xin Tan, Yanyun Qu et al. CVPR 2024 2024

主题
标签
紧凑 Occupancy几何感知编码器语义分组解码器

COTR 用紧凑 triplane feature 与 semantic group 替代全分辨率三维 occupancy tensor,只在最终预测时做密集解码。

55

面向可扩展室内场景的单目占用预测(ISO)

H. Yu et al. ECCV 2024 2024

主题
标签
室内占用深度分布D-FLoSP

ISO 将预训练深度先验注入深度分布 lifting 模块,以扩展单目语义场景补全到更大室内体积。

56

OPUS:使用稀疏集合进行占用预测

Jiawei Wang et al. NeurIPS 2024 2024

主题
标签
稀疏 Query集合预测自适应采样

OPUS 用稀疏点 query 集合预测密集 occupancy 场景,并迭代采样图像特征、精炼位置与语义。

60

QuadricFormer:以 Superquadric 表示场景的三维语义占用预测

Sicheng Zuo, Wenzhao Zheng, Xiaoyong Han et al. Preprint 2025

主题
标签
SuperquadricPrimitive 精炼稀疏场景表示

QuadricFormer 用少量体积 superquadric 表示场景,其形状参数天然同时建模占据内部与目标几何。

61

语义因果感知的视觉三维占用预测(CausalOcc)

Dubing Chen, Huan Zheng, Yucheng Zhou et al. Preprint 2025

主题
标签
因果学习语义反向传播SCAT

CausalOcc 通过语义因果性耦合二维 backbone、三维 lifting 与 occupancy decoder,使下游错误更新真正导致它们的特征。

62

全稀疏三维占用预测(SparseOcc)

Haisong Liu, Yang Chen, Haiguang Wang et al. ECCV 2024 2024

主题
标签
全稀疏Mask Transformer实例占用

SparseOcc 让从相机三维重建到语义与实例 mask 预测的完整 occupancy pipeline 都保持稀疏。

63

SurroundOcc:面向自动驾驶的多相机三维占用预测

Yi Wei, Linqing Zhao, Wenzhao Zheng et al. ICCV 2023 2023

主题
标签
多尺度体积二维到三维提升密集 Occupancy

SurroundOcc 通过将多尺度图像特征提升到三维并渐进精炼 occupancy,建立直接的多相机密集 voxel baseline。

64

UniOcc:自动驾驶占用预测与未来预测统一基准

Yuping Wang, Xiangyu Huang, Xiaokang Sun et al. Preprint 2025

主题
标签
统一基准Occupancy Flow预测评估

UniOcc 跨真实与仿真数据统一当前 occupancy prediction 与未来 occupancy forecasting,并提供 voxel flow 与无需 GT 的质量指标。

65

VGMOcc:使用视觉几何模型的稀疏 Gaussian 占用预测

Anonymous authors ICLR 2026 Submission 2026

主题
标签
视觉几何模型射线采样流式 Gaussian

VGMOcc 沿相机 ray 从 VGM surface point 向内部采样,生成体积 Gaussian occupancy,并跨帧增量融合预测。

68

面向多智能体协同感知的时空域感知

Kun Yang, Dingkang Yang, Jingyu Zhang et al. ICCV 2023 2023

主题
标签
域差异置信度校准重要性感知融合

SCOPE 在融合前校准时序与跨智能体域差异,再根据置信度和任务重要性加权证据。

69

OccuFly:空中视角语义场景补全三维视觉基准

Markus Gross, Sai B. Matha, Aya Fahmy et al. Preprint 2025

主题
标签
空中 SSC真实数据集多高度

OccuFly 建立真实世界空中语义场景补全基准,覆盖 RGB、度量深度、occupancy 标签以及多季节、多高度与多场景。

70

V2XPnP:面向多智能体感知与预测的 V2X 时空融合

Zewei Zhou, Hao Xiang, Zhaoliang Zheng et al. Preprint 2024

主题
标签
感知预测联合时序融合地图注意力

V2XPnP 在一个共享 V2X 场景 state 中联合多智能体时序融合、当前三维检测与未来轨迹预测。

71

VOGS-CP:用于协同语义占用预测的纯视觉 Gaussian Splatting

Cheng Chen, Hao Huang, Saurabh Bagchi Preprint 2025

主题
标签
协同 Gaussian纯视觉Gaussian 封装

VOGS-CP 传输稀疏场景 Gaussian 而非密集 voxel 或平面 BEV feature,为协同 occupancy 保留三维结构。

72

Video-3D LLM:学习位置感知视频表示用于三维场景理解

Duo Zheng, Shijia Huang, Liwei Wang CVPR 2025 2025

主题
标签
视频 LLM三维位置编码密集描述

Video-3D LLM 将视频 patch token 与全局三维坐标对齐,使 LLM 可在度量空间中问答、区域描述与目标定位。

73

NeRF²:神经射频辐射场

Xiaopeng Zhao, Zhenlin An, Qingrui Pan, Lei Yang MobiCom 2023 2023

主题
标签
射频场神经渲染无线感知

NeRF² 将坐标神经场与可微渲染从光学扩展到无线传播,重建复杂环境中的射频信号。

74

NeRF:用于新视图合成的神经辐射场场景表示

Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik et al. ECCV 2020 2020

主题
标签
神经场体渲染新视图合成

NeRF 将场景表示为连续坐标 MLP,并通过有位姿图像的可微体渲染进行训练。

77

面向车路协同感知的任务导向通信

Jiawei Shao, Teng Li, Jun Zhang MLSP 2024 2024

主题
标签
车路协同任务导向编码层级熵

TOCOM-V2I 通过路侧空间相关性与层级熵编码发送紧凑特征,直接优化车辆检测质量。

78

面向自动驾驶的车联网协同感知

Tao Huang, Jianan Liu, Xi Zhou et al. Proceedings of the IEEE 2025

主题
标签
V2X 综述融合分类开放挑战

该综述从感知准备、通信、对齐、融合到下游输出系统整理 V2X 协同感知,并揭示部署缺口。

79

V2X-PC:通过点簇进行车联网协同感知

Si Liu, Zihan Ding, Jiahui Fu et al. IEEE TPAMI 2025

主题
标签
点簇稀疏通信图聚合

V2X-PC 用点簇替代密集 BEV 消息,在长距离协作中保留局部几何、语义与显式目标结构。

80

Who2com:通过可学习握手通信进行协同感知

Yen-Cheng Liu, Junjiao Tian, Chih-Yao Ma et al. ICRA 2020 2020

主题
标签
握手通信伙伴选择带宽感知

Who2com 通过为感知效用学习的 request-match-connect 握手,将低成本伙伴发现与高成本数据交换分离。

83

Attention Is All You Need

Ashish Vaswani, Noam Shazeer, Niki Parmar et al. NeurIPS 2017 2017

主题
标签
自注意力编码器解码器序列建模

Transformer 在 encoder-decoder 架构中以并行 multi-head attention、位置编码、残差路径与前馈 block 替代 recurrence。