에이전틱 월드 모델 학습을 위한 비디오 데이터 탐색
Session Overview
보고, 이해하고, 행동할 수 있는 시스템을 만들기 위해 실제로 필요한 것은 무엇일까?
Vision-Language-Action 모델의 등장으로 피지컬 AI는 이른바 'Attention Is All You Need' 순간을 맞이했다. 다음 병목은 데이터다. 단순히 더 많은 영상이 아니라, 중력과 움직임, 인과관계, 인간의 행동, 사물과의 상호작용 등 세상이 작동하는 원리를 모델에게 가르쳐줄 수 있는 정확한 현실의 순간들을 찾아내는 능력이 관건이다.
이번 세션에서는 방대한 웹 데이터 속에서 특정 장면을 발굴해내는 새로운 접근법을 소개한다. 물체가 떨어지는 순간, 사람이 환경과 상호작용하는 장면, 시간에 따라 전개되는 행동 등을 팀이 어떻게 검색하고, 학습과 평가에 필요한 관련 클립만을 수집·구조화할 수 있는지를 살펴본다.
Speaker
박종우
Sales Representative
Bright Data
연사 소개는 추후 업데이트될 예정입니다.