machine-learning — Page 53

1个月前 · ai

[Paper] 关键差异：审计模型用于能力差距的发现与纠正

传统的多模态大语言模型（MLLM）评估方法缺乏可解释性，且往往不足以充分揭示跨…的显著能力差距。

#research #paper #ai #machine-learning #computer-vision
1个月前 · ai

[Paper] DVGT: 驱动视觉几何Transformer

从视觉输入感知和重建 3D 场景几何对于自动驾驶至关重要。然而，目前仍缺乏针对驾驶任务的稠密几何。

#research #paper #ai #machine-learning #computer-vision
1个月前 · ai

[Paper] EasyV2V：高质量基于指令的视频编辑框架

虽然 image editing 发展迅速，但 video editing 仍然较少被探索，面临 consistency、control 和 generalization 的挑战。我们研究了设计...

#research #paper #ai #machine-learning #computer-vision
1个月前 · ai

[Paper] 生成式对抗推理器：通过对抗强化学习提升 LLM 推理能力

Large language models (LLMs) 具备显式推理能力，在数学推理方面表现出色，但仍会出现过程错误，例如计算错误……

#research #paper #ai #machine-learning #nlp
1个月前 · ai

[Paper] 探索 vs. 利用：通过 Clipping、Entropy 和虚假奖励重新思考 RLVR

本文研究了在可验证奖励（RLVR）强化学习框架中探索‑利用的权衡，这一框架用于提升推理的……

#research #paper #ai #machine-learning #nlp
1个月前 · ai

[Paper] 后验行为克隆：为高效RL微调预训练BC策略

在从机器人到语言等各个领域，标准做法是首先在大规模 demonstration dataset 上对 policy 进行 pretrain，然后对该 policy 进行 finetune，……

#research #paper #ai #machine-learning
1个月前 · ai

[Paper] SFTok：弥合离散分词器的性能差距

近期在多模态模型方面的进展凸显了图像标记化在高分辨率图像生成中的关键作用。通过将图像压缩成紧凑的...

#research #paper #ai #machine-learning #computer-vision
1个月前 · ai

[Paper] 从推理到运动的流动：从第一人称人类交互视频中学习3D手部轨迹预测

先前关于3D 手部轨迹预测的工作受到数据集的限制，这些数据集将运动与语义监督解耦，并且模型在推理方面的关联较弱。

#research #paper #ai #machine-learning #computer-vision
1个月前 · ai

[Paper] 上下文代数

我们研究当 transformer 被训练用于在序列上求解算术时出现的机制，这些序列中的 token 是其含义由…决定的变量。

#research #paper #ai #machine-learning #nlp
1个月前 · ai

[Paper] 新闻 AI 的历史训练数据中种族偏见的影响

AI 技术已迅速进入涉及大规模文本语料库的商业和研究应用领域，包括 computational journalism 研究和新闻……

#research #paper #ai #machine-learning #nlp
1个月前 · ai

[Paper] LinkedOut：从 Video LLM 中链接世界知识表示以实现下一代视频推荐

视频大型语言模型（VLLMs）通过在互联网规模的数据上进行预训练，解锁了具备世界知识感知的视频理解，并已显示出前景……

#research #paper #ai #machine-learning #computer-vision
1个月前 · ai

[论文] Cartesian-nj：将 e3nn 扩展到不可约笛卡尔张量乘积和收缩

等变原子级机器学习模型在外推能力和预测精度方面都带来了显著提升。取决于…的基础，

#research #paper #ai #machine-learning

Newer posts

Older posts