[Paper] SpatialTree: MLLM에서 공간 능력이 어떻게 확장되는가
인지 과학은 공간 능력이 인식에서 추론 및 상호작용으로 점진적으로 발달한다고 제안합니다. 그러나 멀티모달 LLMs(MLLMs)에서는 이 계층…
인지 과학은 공간 능력이 인식에서 추론 및 상호작용으로 점진적으로 발달한다고 제안합니다. 그러나 멀티모달 LLMs(MLLMs)에서는 이 계층…
현재 video avatar generation 방법은 identity preservation과 motion alignment에서 뛰어나지만, genuine agency가 부족하고 장기적인 목표를 자율적으로 추구할 수 없습니다.
최근 연구에 따르면 대형 언어 모델(LLMs)을 직접 파인튜닝하여 dense retrieval을 수행하면 강력한 성능을 얻을 수 있지만, 그들의 상당한 파라미터 수...
본 논문은 연합 학습에서 학습 효율성과 통신 비용을 최적화하기 위해 FedPOD (Proportionally Orchestrated Derivative)를 제안한다.
Neural networks가 gradient descent로 훈련될 때, 시간에 따라 복잡도가 증가하는 해결책을 학습하는 경우가 많으며, 이는 simplicity bias라고 알려진 현상이다. Despite being wid...
포인트 트래킹은 비디오 프레임 간에 대응되는 포인트를 위치 지정하는 것을 목표로 하며, 4D 재구성, 로보틱스 및 비디오 편집을 위한 기본 작업이다. Exis...
다음 토큰 예측을 사전 학습하고 강화 학습(RL)으로 미세 조정된 대규모 자동회귀 모델은 많은 분야에서 전례 없는 성공을 거두었습니다.
우리는 MoE‑DiffuSeq를 제시한다. 이는 mixture of experts 기반 프레임워크로, 긴 문서 생성에서 diffusion 모델을 향상시키기 위한 것이다. 기존 diffusion 기반 텍스트 생성…
우리는 Cube Bench를 소개합니다. 이는 Rubik's-cube 벤치마크로, 멀티모달 대형 언어 모델(MLLMs)의 공간 및 순차적 추론을 평가하기 위해 설계되었습니다. 이 벤치마크는 ...
시스템 엔지니어링(SE) 목표가 단일 시스템의 설계 및 운영에서 복잡한 System of Systems(SoS)로 진화함에 따라, 미션 엔지니어링 분야는…
Stereotactic radiosurgery (SRS)는 중요한 구조물 주변에 정밀한 dose shaping을 요구하지만, black-box AI 시스템은 불투명성 때문에 임상 채택이 제한적이다 ...
우리는 ReLU 신경망의 출력이 제로섬, 턴제, 스톱핑 게임의 값으로 해석될 수 있음을 보여준다. 우리는 이를 ReLU net game이라고 부른다. …