· ai
[Paper] ARM-Thinker:通过代理式工具使用和视觉推理强化多模态生成式奖励模型
奖励模型对于使视觉语言系统与人类偏好保持一致至关重要,但当前的方法存在幻觉、视觉定位薄弱等问题,……
671 posts from this source
奖励模型对于使视觉语言系统与人类偏好保持一致至关重要,但当前的方法存在幻觉、视觉定位薄弱等问题,……
我们介绍了 ShadowDraw,一个将普通 3D 对象转化为阴影绘画构图艺术的框架。给定一个 3D 对象,我们的系统预测场景参数……
标准扩散通过高斯噪声对数据进行破坏,其傅里叶系数具有随机幅度和随机相位。虽然在无条件或……
在大型语言模型(LLMs)中,长上下文推理已通过链式思考(CoT)推断展示了其认知能力的提升。训练...
All-in-One Image Restoration (AiOIR) 任务通常涉及多样的退化,需要稳健且多功能的策略。然而,大多数现有方法 typ...
视频生成模型正在快速发展,但在需要大量语义分支或重复高…的复杂视频输出方面仍可能面临困难。
最近关于结构化文本翻译的研究仍局限于句子层面,因为它们难以有效处理复杂的文档级 XML 或 HTML …
近年来,针对 AI 生成图像(AIGI)的图像质量评估(IQA)发展迅速;然而,现有方法主要针对肖像和 ar...
尽管扩散模型如今在生成建模中占据核心位置,入门教材通常假设欧几里得数据,并且很少阐明它们的…
现实世界的物理过程并不会产生任意的变异性:它们的信号集中在紧凑且低变异性的 functional space 子集上。这个……
大语言模型(LLM)推理需要巨大的计算和能源,使得特定领域的任务成本高昂且不可持续。随着基础模型的规模不断扩大……
随着医疗保健日益转向 AI,以实现可扩展且可信赖的临床决策支持,确保模型推理的可靠性仍然是一个关键挑战。