SceneBind: Binding What and Where Across Vision, Audio and Language
https://arxiv.org/abs/2607.15265
Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman | University of Washington, University of Texas at Dallas, Hankuk University of Foreign Studies | arXiv:2607.15265 | 2026년 7월
1. 서론: 공통 의미 벡터에서 객체별 3D 배치로
SceneBind가 다루는 장면 이해는 범주 인식을 넘어, 무엇이 존재하고 그 대상이 관찰자 기준 3차원 공간의 어디에 있는지를 함께 표현하는 문제다. 영상은 외형과 화면상 배치를, 바이노럴 오디오는 시야 밖이나 가려진 음원의 방향 단서를, 언어는 장면과 객체의 해석 가능한 의미를 제공한다. 목표는 세 모달리티를 같은 의미 공간에 놓는 데서 끝나지 않고, 서로 다른 감각에서 관찰된 동일 객체의 의미와 방위각·고도·거리를 대응시키는 것이다. SceneBind는 이 문제를 장면 전체와 객체 단위를 분리한 의미-공간 표현 학습으로 정식화한다.
CLIP, SigLIP, CLAP, ImageBind 계열의 대규모 대조학습은 서로 다른 모달리티가 같은 장면이나 개념을 가리킬 때 전역 임베딩을 가깝게 만드는 데 성공했다. 그러나 하나의 벡터에 장면 전체를 압축하면 ‘거리에서 자동차와 사람이 함께 있다’는 전반적 내용은 보존할 수 있어도, 자동차는 오른쪽 가까이에 있고 사람은 왼쪽 멀리에 있다는 객체별 배치를 명시적으로 분해하기 어렵다. 서로 다른 공간 배열을 가진 두 장면이 같은 객체 집합을 포함하면 전역 코사인 유사도는 높게 나올 수 있고, 어느 음원이 어느 시각 객체와 대응하는지도 벡터 하나만으로는 드러나지 않는다. 즉 기존 omni-modal encoder는 ‘무엇’에 강하지만, 복수 객체의 ‘어디’를 질의하고 비교할 수 있는 구조를 출력 형식에 포함하지 않는다.
이 한계는 사전학습 과정의 불변성 설계와 입력 전처리에서도 생긴다. 이미지의 좌우 반전이나 회전은 의미 범주를 유지하는 증강으로 취급되기 쉽지만, 공간 추론에서는 왼쪽과 오른쪽을 뒤바꾸는 변환이므로 같은 표적으로 간주할 수 없다. 오디오를 모노로 다운믹스하면 음원 정체성을 나타내는 스펙트럼은 남아도 양이 간 레벨 차이와 위상 차이가 사라져 수평 방향 추정에 필요한 물리 단서가 훼손된다. 의미에 유리한 불변성과 위치에 필요한 민감성이 충돌하므로, SceneBind는 의미 인코딩과 공간 증거 추출을 구분한 뒤 객체 수준에서 다시 결합한다.
SceneBind의 핵심 출력은 전역 의미 임베딩 하나와 고정 개수의 객체 슬롯 집합을 함께 두는 것이다. 각 슬롯은 객체 의미 벡터, 방위각·고도·거리의 예측 분포, 그리고 해당 슬롯이 실제 활성 객체를 나타내는지를 표시하는 confidence를 포함한다. 고정된 슬롯 수는 배치 연산을 가능하게 하고, confidence와 이분 매칭은 장면마다 달라지는 실제 객체 수를 흡수한다. 이 설계 덕분에 학습에서는 전역 의미 정렬과 객체 grounding을 함께 적용하고, 추론에서는 빠른 전역 검색 뒤 의미와 3차원 배치가 맞는 후보를 객체 수준으로 재정렬할 수 있다.
Table 1. SceneBind 표현 스키마 요약
| 구성 | 형태 | 역할 |
|---|---|---|
| 전역 의미 | $\mathbf{s}_{\mathrm{global}}\in\mathbb{R}^{d}$ | 장면 전체의 의미와 빠른 1차 검색 |
| 객체 의미 | $\mathbf{s}_{k}\in\mathbb{R}^{d}$ | 객체 절과의 의미 대응 |
| 공간 분포 | $\mathbf{r}_{k}=(\theta_k,\phi_k,d_k)$ | 방위각 7·고도 5·거리 4개 구간 |
| 활성도 | $c_k\in[0,1]$ | 실제 객체 슬롯인지에 대한 confidence |
이 표의 구분은 단지 구현 편의를 위한 분해가 아니다. 전역 벡터는 장면 전체의 문맥을 빠르게 비교하고, 슬롯은 같은 객체 집합을 가진 후보들 사이에서 배치 차이를 다시 확인한다. 공간값을 확률분포로 유지하면 인접 구간의 모호성을 표현할 수 있고, confidence는 저품질 슬롯이 검색 점수를 지배하는 것을 억제한다.
2. 배경 및 관련 연구: 무엇을 맞추는 정렬에서 어디를 보존하는 표현으로
영상-텍스트 사전학습은 이미지와 문장을 공유 임베딩에 배치하고, 오디오-텍스트 사전학습은 같은 원리를 소리와 언어로 확장했다. AudioCLIP은 텍스트를 매개로 영상과 오디오를 연결하고, ImageBind는 이미지를 중심 축으로 삼아 더 많은 감각 신호를 결합함으로써 cross-modal retrieval과 zero-shot 전이를 가능하게 했다. 이 계열의 공통 단위는 샘플 전체를 대표하는 전역 벡터이며, 양성 쌍은 같은 장면이나 같은 의미를 공유하는지로 정의된다. SceneBind는 이 의미 기반을 폐기하지 않고 SigLIP2와 M2D-CLAP을 동결된 기반 인코더로 재사용하되, 전역 벡터 아래에 객체별 공간 구조를 추가한다.
전역 정렬의 장점은 모달리티마다 입력 형태가 달라도 같은 개념을 코사인 유사도로 비교할 수 있다는 점이지만, 장면 내부의 대응 관계는 평균화된다. 예를 들어 ‘개가 짖고 자동차가 지나가는 장면’이라는 영상과 오디오는 전역 수준에서 맞는 쌍이어도, 짖는 개와 엔진음을 각각 어느 방향에서 찾아야 하는지는 별도 구조가 없으면 감독할 수 없다. 전역 임베딩을 여러 차원으로 크게 만드는 것만으로는 각 하위 성분이 특정 객체와 좌표를 의미한다고 보장되지 않으며, 객체 수가 바뀌는 경우에도 해석 가능한 인덱스를 제공하지 않는다. SceneBind의 object slot은 이 누락을 출력 스키마에서 직접 다루며, slot confidence와 공간 확률분포로 객체 존재 여부와 위치 불확실성을 함께 남긴다.
시각 중심의 공간 표현은 포인트 클라우드, 복셀, 지도, 장면 그래프, 신경장 등으로 3차원 구조를 보존해 왔다. 객체 검출과 grounding은 화면 영역을 언어 구절에 연결하고, object-centric representation은 복수 대상을 분리해 장면의 세부 구조를 다룬다. 다만 이러한 방법은 특정 센서나 전경 객체에 국한되거나, 영상·오디오·텍스트를 동일한 검색 표현으로 비교하기보다 한 모달리티 안의 위치 추정에 초점을 두는 경우가 많다. SceneBind는 조밀한 3차원 재구성 대신 방위각·고도·거리로 요약된 소수의 슬롯을 사용해, 장면 검색에 필요한 압축성과 객체 grounding에 필요한 구조성을 절충한다.
오디오-비주얼 위치 추정의 상당수는 모노 소리와 영상의 동시성을 이용해 화면에서 소리 나는 영역을 찾는다. 이 방식은 음원이 화면 밖에 있거나 가려져 있거나, 여러 물체가 비슷한 운동을 보일 때 시각 단서에 과도하게 의존할 수 있다. 바이노럴 오디오는 좌우 채널의 크기와 위상 차이를 통해 방향에 관한 직접 단서를 제공하지만, 현실 녹음의 센서 편차와 잔향 때문에 의미 인식과 동일한 경로에서 한 번에 학습하기 어렵다. SceneBind는 모노 혼합에서 음향 의미를 추출하는 사전학습 branch와 원래 두 채널에서 공간 단서를 추출하는 branch를 분리하고, 길이를 맞춘 토큰 수준에서 둘을 더해 spatial decoder에 제공한다.
기존 프로젝트 맥락에서 MemEye 글은 메모리의 시각 증거 보존을, tri-modal-biomedical-alignment는 의료 모달리티의 공통 임베딩 정렬을 다룬다. multimodal-data-supply-chain은 권리·품질·주석·검수의 공급망이 표현 성능을 제한한다는 점을 강조한다. SceneBind 역시 공통 의미 공간과 정렬 데이터에 의존하지만, 전역 의미에 객체 의미·3차원 위치 분포·활성 confidence를 추가한다는 점에서 범위가 다르다. 이는 증거 보존이나 데이터 공급망의 대체재라기보다, 검수된 공간 주석이 표현과 매칭 규칙에 반영되는 모델 계층의 사례다.
3. 방법론: 전역 의미와 객체별 공간 슬롯을 결합하는 SceneBind
SceneBind는 영상 I, 오디오 A, 텍스트 T로 관찰되는 하나의 장면을 의미-공간 개체로 정의한다. 텍스트는 장면 전체 설명과 객체별 절로 구성되며, 각 객체 절에는 카메라 좌표계의 방위각 $\theta$, 고도 $\phi$, 거리 d가 연결된다. 각 모달리티의 출력 X는 d차원 전역 의미 벡터와 K개 객체 슬롯의 집합이고, 슬롯 k는 의미 벡터 s_k, 공간 속성 r_k, confidence c_k의 튜플이다. 구현에서 K는 50으로 고정되지만 실제 활성 객체 수는 confidence와 이후 매칭으로 결정된다.
- 장면 전체를 나타내는 전역 embedding 한 개를 모든 모달리티에서 공통 의미 공간으로 정렬한다.
- 각 객체 slot은 의미 vector, 방위각·고도·거리 분포, confidence를 함께 출력한다.
- 학습에서는 이분 매칭으로 순서 없는 예측 slot과 객체 절을 대응시킨다.
- 추론에서는 전역 검색으로 상위 후보를 좁힌 뒤 slot score로 재순위화한다.
$$\mathcal{X}=\left(\mathbf{s}_{\mathrm{global}},\left\{(\mathbf{s}_{k},\mathbf{r}_{k},c_{k})\right\}_{k=1}^{K}\right),\qquad \mathbf{r}_{k}=(\theta_k,\phi_k,d_k).$$
표현을 두 층으로 나눈 이유는 전역 문맥과 객체별 위치가 요구하는 집계 방식이 다르기 때문이다. 전역 query는 패치 토큰 전체를 모아 장소와 사건의 총체적 의미를 압축하고, 객체 query들은 같은 문맥을 서로 다른 잠재 anchor에서 읽어 복수 객체 후보를 만든다. 공간 좌표는 단일 연속값으로 회귀하지 않고 방위각 7개, 고도 5개, 거리 4개 bin의 확률분포로 예측해 모호성과 근접 범주를 표현한다. confidence는 그 슬롯이 활성 객체인지 나타내는 별도 확률이며, 공간 분포와 함께 추론 단계에서 불확실한 대응의 영향력을 낮춘다.
시각 branch는 동결된 SigLIP2 visual tower가 프레임마다 256개의 patch token을 출력하며, 각 토큰 차원은 1,152다. 패치 순서는 영상의 배치를 유지하므로 semantic decoder에는 객체 정체성의 증거를, spatial decoder에는 화면 위치의 증거를 동시에 제공한다. 학습 중 수평 반전을 적용할 때는 시각 특징만 뒤집지 않고 방위각 라벨도 함께 반전해, 의미 증강이 좌우 공간 감독을 훼손하지 않도록 한다. 별도의 조밀한 깊이 입력 없이도 거리를 분류하지만, 그 거리 신호는 데이터의 객체별 공간 라벨에 의해 감독된다.
텍스트 branch는 같은 SigLIP2의 동결된 text tower를 사용해 영상과 공유된 1,152차원 의미 공간을 유지한다. 전역 장면 설명은 scene-level alignment 표적이 되고, 각 객체 절은 독립적인 1,152차원 임베딩으로 인코딩되어 slot 의미 표적이 된다. 객체 절의 방위각·고도·거리 라벨은 이산 bin의 one-hot target으로 제공되며, 텍스트에는 영상·오디오와 같은 학습형 spatial head를 두지 않는다. 따라서 텍스트는 의미 anchor이자 좌표 감독의 전달자지만, cross-scene spatial contrastive loss에 쓸 spatial-head feature는 제공하지 않는다.
오디오 의미 branch는 두 채널을 평균한 모노 신호를 16kHz로 리샘플한 뒤, 동결된 M2D-CLAP으로 768차원 patch token을 추출한다. 서로 다른 사전학습 공간을 잇기 위해 5개 residual block, hidden width 1,024, LayerNorm, GELU의 residual MLP가 토큰을 SigLIP2의 1,152차원으로 투영한다. 이 모듈은 Binaural caption에서 두 특징 공간을 맞추도록 선행 학습된 뒤 M2D backbone과 함께 동결된다. 10초 창의 최종 의미 표현은 5×62 grid를 펼친 310×1,152 토큰이다.
오디오 공간 branch는 의미 branch와 달리 원래의 좌우 채널을 유지하고, 16kHz 신호에 FFT 크기 1,024와 hop 512의 STFT를 적용한다. 입력은 왼쪽 magnitude·phase와 오른쪽 magnitude·phase를 쌓은 4채널 시간-주파수 표현이며, 좌우 레벨 차이와 위상 차이를 보존한다. 세 개의 convolution block은 각각 3×3 convolution, 64개 출력 채널, ReLU, batch normalization, 주파수 축 max pooling으로 구성되고 처음부터 학습된다. 남은 주파수 차원을 평균한 64차원 시간열은 1,152차원으로 투영되고 길이 310으로 선형 보간된 뒤, M2D 의미 토큰과 원소별로 더해져 fused audio context를 이룬다.
각 영상·오디오 branch의 semantic decoder는 학습 가능한 global query 하나와 object query 50개를 사용하는 1층 Transformer decoder다. query들은 모달리티별 semantic context token에 cross-attention하며, global query의 출력은 전역 의미 임베딩으로 사용된다. 각 object query의 출력은 projection을 거쳐 객체 의미 슬롯이 되고, 별도 confidence head와 sigmoid가 0에서 1 사이의 활성 점수를 만든다. 이 단계는 아직 좌표를 직접 읽기 전에 ‘어떤 객체가 있을 수 있는가’라는 의미 가설을 먼저 만들며, 순서가 없는 50개 가설 중 일부만 실제 객체로 선택되도록 한다.
$$[\mathbf{s}^{m}_{\mathrm{global}},\mathbf{s}^{m}_{1},\ldots,\mathbf{s}^{m}_{K}]=\operatorname{Dec}_{\mathrm{sem}}(Q;H^{m}),\qquad c^{m}_{k}=\sigma(g^{m}_{\mathrm{conf}}(\mathbf{h}^{m}_{k})).$$
spatial decoder는 각 semantic object slot을 query로 사용해 그 객체와 관련된 위치 증거를 다시 context token에서 읽는다. 영상에서는 SigLIP2 patch token을 memory로 사용하고, 오디오에서는 의미 토큰과 바이노럴 공간 토큰을 더한 fused context를 memory로 사용한다. decoder 출력은 모달리티별 projection을 통해 방위각·고도·거리의 spatial embedding으로 변환되고, 공유된 세 분류기가 각각 7·5·4개 bin의 확률분포를 출력한다. 최종 좌표 범주는 각 분포의 argmax지만 학습과 매칭에서는 최대 범주에 그치지 않고 softmax 분포 전체를 사용하므로 인접 위치에 대한 모호성을 보존한다.
전역 감독에는 audio-visual, audio-text, visual-text 쌍마다 대칭 InfoNCE를 적용한다. 같은 장면의 쌍은 positive이고 minibatch의 다른 장면은 negative이며, 정방향과 역방향 손실을 평균한다. 정규화된 전역 embedding 내적을 logit으로 사용하고 온도 $\tau$는 0.07이며, 텍스트 표적은 장면 설명 embedding이다. 기본 가중치는 세 쌍에 각각 2.0, 1.0, 1.0이다.
객체 감독의 첫 난점은 50개 예측 슬롯에 고정된 의미 순서가 없고, 정답 객체 수는 장면마다 다르다는 점이다. SceneBind는 예측 슬롯 i와 정답 객체 절 j 사이의 점수 a_ij를 의미 cosine, 공간 일치도 $\rho$_ij, 슬롯 confidence의 조합으로 만들고, 전체 점수 합을 최대화하는 일대일 이분 매칭을 수행한다. 공간 일치도는 슬롯의 방위각·고도·거리 softmax 분포가 정답 bin에 부여한 확률의 평균이며, λ는 의미와 공간의 비중을, α와 β는 confidence 반영 강도를 조절한다. 이 할당은 어떤 슬롯이 어느 객체를 담당할지 먼저 정한 뒤 손실을 계산하게 하므로, slot index 자체에 임의의 객체 순서를 강제하지 않는다.
$$a_{ij}=\big[(1-\lambda)\cos(\mathbf{s}_{i},\mathbf{s}^{*}_{j})+\lambda\rho_{ij}\big](\alpha+\beta c_i).$$
매칭된 슬롯에는 객체 절 embedding과의 cosine distance로 semantic grounding loss를 적용한다. 방위각·고도·거리는 이산 bin에 대한 Gaussian-smoothed cross-entropy로 감독해, 정답 바로 옆 bin의 예측이 멀리 떨어진 bin의 예측보다 작은 벌점을 받게 한다. 방위각은 원형 좌표임을 반영해 σ=1.0의 circular smoothing을 쓰고, 고도와 거리는 σ=0.5의 non-circular smoothing을 사용한다. confidence에는 binary cross-entropy를 적용해 매칭 슬롯을 positive, 남은 슬롯을 negative로 두며, 기본 객체 손실 가중치는 의미 1.0, confidence 2.0, 방위각 1.0, 고도 0.5, 거리 0.5다.
이분 매칭은 grounding 표적과 더불어 모달리티 간 객체 대조학습의 positive 관계도 정의한다. intra-scene loss는 같은 정답 객체 절에 함께 매칭된 두 모달리티의 슬롯을 positive로, 같은 장면의 다른 객체 슬롯을 negative로 두어 동시에 나타난 객체들이 하나의 의미로 섞이지 않게 한다. audio-text와 visual-text에서도 객체 절 embedding이 해당 슬롯의 positive가 되고 같은 장면의 다른 절이 negative이며, 함께 매칭된 객체가 하나뿐이면 paired cosine alignment로 축약된다. 기본 intra-scene 가중치는 audio-visual 1.0, audio-text 1.0, visual-text 0.5다.
cross-scene loss는 minibatch 전체의 매칭 객체를 비교해 장면이 달라도 객체를 구별하게 한다. audio-visual 쌍에는 semantic slot과 분류기 직전의 방위각·고도·거리 embedding에 대칭 InfoNCE를 적용하며, 고도와 거리 항은 방위각의 절반 가중치를 갖는다. 텍스트에는 학습된 spatial-head feature가 없으므로 audio-text와 visual-text에는 semantic 항만 적용된다. 기본 가중치는 세 쌍에 각각 2.0, 0.5, 0.5이고, 최종 손실은 전역 정렬·객체 grounding·intra-scene·cross-scene 항의 가중합이다.
$$\mathcal{L}_{\mathrm{batch}}^{A,V}=\mathcal{L}_{\mathrm{NCE}}(\mathbf{s}^{A},\mathbf{s}^{V})+\mathcal{L}_{\mathrm{NCE}}(\mathbf{u}^{A,\theta},\mathbf{u}^{V,\theta})+\frac{1}{2}\mathcal{L}_{\mathrm{NCE}}(\mathbf{u}^{A,\phi},\mathbf{u}^{V,\phi})+\frac{1}{2}\mathcal{L}_{\mathrm{NCE}}(\mathbf{u}^{A,d},\mathbf{u}^{V,d}).$$
추론 시에는 각 모달리티를 동일한 전역 벡터와 객체 슬롯 집합으로 변환한 뒤, confidence가 0.05를 넘는 슬롯만 활성화한다. 문턱을 넘는 슬롯이 하나도 없으면 최고 confidence 슬롯 하나를 남겨 빈 표현이 되는 것을 막는다. 두 활성 슬롯 i와 j의 pair score는 semantic cosine에 공간 일치도 $\rho$_ij를 곱한 값이며, $\rho$_ij는 방위각·고도·거리 예측 분포 내적을 2:1:1로 가중 평균한다. 바이노럴 설정에서 수평 방향이 핵심 단서이므로 방위각에 두 배 가중치를 주고, 좌표를 argmax 범주 하나로 축소하지 않고 분포 간 합치도를 비교한다.
$$R_{ij}(q,x)=\cos(\mathbf{s}^{q}_{i},\mathbf{s}^{x}_{j})\rho_{ij},\qquad \rho_{ij}=\frac{2\langle\boldsymbol{\pi}^{q,\theta}_{i},\boldsymbol{\pi}^{x,\theta}_{j}\rangle+\langle\boldsymbol{\pi}^{q,\phi}_{i},\boldsymbol{\pi}^{x,\phi}_{j}\rangle+\langle\boldsymbol{\pi}^{q,d}_{i},\boldsymbol{\pi}^{x,d}_{j}\rangle}{4}.$$
객체 sample score는 학습 때의 일대일 매칭과 달리, 각 query slot이 candidate의 최적 슬롯을 독립 선택하는 best-match 방식이다. pair score에는 두 confidence의 기하평균을 곱하고, 선택된 점수를 confidence 가중치 합으로 나눠 활성 슬롯 수의 영향을 제어한다. 이 방식은 일부 객체만 겹치거나 객체 수가 달라도 부분 일치를 허용하지만, 여러 query가 같은 candidate slot을 고를 수 있어 학습용 Hungarian assignment와 목적이 다르다. 전역 점수는 global embedding의 cosine으로 별도 계산해 객체 대응이 불안정해도 전체 문맥을 유지한다.
$$S_{\mathrm{obj}}(q,x)=\frac{\sum_i w_{ij_i^{\star}}R_{ij_i^{\star}}(q,x)}{\sum_i w_{ij_i^{\star}}+\epsilon},\qquad S_{\mathrm{scene}}=\bar S_{\mathrm{global}}+\lambda_{\mathrm{obj}}\bar S_{\mathrm{obj}}.$$
scene retrieval은 먼저 전역 점수로 모든 후보를 정렬하고 상위 50개에만 계산량이 큰 객체 점수를 적용한다. query별 후보 집합에서 전역 점수와 객체 점수를 각각 min-max normalization한 뒤 더하며, object score 가중치는 audio-visual 검색에서 0.05, 텍스트 관련 검색에서 0.5다. 이는 객체 슬롯만으로 전체 장면을 대체하는 방식에서 벗어나 전역 검색을 기본 축으로 유지하면서, 텍스트가 명시한 객체와 위치 조건이 있는 경우 semantic-spatial 일치의 영향력을 더 크게 주는 재정렬 규칙이다. 결과적으로 SceneBind Matching은 ‘같은 종류의 장면인가’와 ‘그 장면 안의 대응 객체가 같은 방향·고도·거리에 있는가’를 분리해 계산한 뒤 과업에 맞는 비중으로 결합한다.
3.1 인코더에서 검색 점수까지의 정보 흐름
입력 모달리티는 서로 다른 물리량을 갖지만 출력 인터페이스는 동일하다. 영상의 패치 토큰은 물체 외형과 화면 좌표를, 모노 오디오 의미 토큰은 사건의 음향 정체성을, 바이노럴 STFT 토큰은 좌우 채널 차이에서 얻은 방향 증거를 제공한다. semantic decoder는 이 문맥에서 장면 전체와 객체 후보를 만들고, spatial decoder는 각 객체 후보를 query로 삼아 위치 관련 토큰을 다시 읽는다. 이 순서를 쓰면 공간 head가 장면 전체를 평균내는 대신 특정 객체 가설과 연관된 위치 증거를 모을 수 있다.
오디오 branch에서 의미와 공간 경로를 분리한 선택은 정보 보존 관점에서 중요하다. M2D-CLAP이 요구하는 모노 입력은 화자·차량·파도 같은 사건 의미를 안정적으로 추출하지만, 두 채널을 평균하는 순간 interaural level difference와 interaural phase difference가 사라진다. 별도의 STFT 경로는 왼쪽과 오른쪽 magnitude·phase를 네 채널로 유지하므로 의미 encoder가 버린 공간 단서를 복구한다. 길이 310으로 맞춘 뒤 두 토큰열을 더하는 구성은 각 시간 패치의 사건 의미와 양이 단서를 같은 decoder memory에 놓는 간결한 결합 방식이다.
영상 branch의 수평 반전 처리도 같은 원리를 따른다. 일반 이미지 대조학습에서는 좌우 반전이 범주 의미를 보존하는 증강으로 쓰이지만, 이 과제에서 왼쪽 자동차를 오른쪽 자동차와 동일한 위치 표적으로 두면 공간 head가 방향을 무시하게 된다. SceneBind는 반전된 시각 feature를 사용할 때 방위각 라벨도 거울상으로 바꾸어 의미 invariance와 공간 equivariance를 분리한다. 논문이 고도와 거리를 같은 방식으로 변환하지 않는 이유는 수평 반전이 그 두 축의 카메라 좌표를 바꾸지 않기 때문이다.
이분 매칭 점수는 의미 cosine, 세 공간 분포가 정답 bin에 부여한 확률, slot confidence를 함께 사용한다. 의미만으로 할당하면 동일 범주의 복수 객체가 섞이고, 위치만으로 할당하면 의미가 다른 객체가 우연히 같은 bin에 있을 때 잘못 대응할 수 있다. confidence는 실제 객체를 나타낼 가능성이 낮은 slot이 할당을 차지하는 것을 억제한다. 매칭 뒤에 semantic loss와 공간 classification loss를 계산하므로, 고정된 slot index가 항상 사람이나 자동차를 뜻한다고 가정할 필요가 없다.
추론의 best-match는 학습의 일대일 할당과 의도적으로 다르다. 검색 질의와 후보는 객체 수가 다르고 일부 객체만 공유할 수 있으므로, 모든 slot을 강제로 일대일 대응시키면 관련 없는 예측이 점수를 깎는다. 각 query slot이 candidate의 가장 잘 맞는 slot을 독립적으로 고르면 부분 장면과 가려진 객체에도 대응할 수 있고, confidence의 기하평균이 반복되는 저품질 가설의 영향을 줄인다. 대신 여러 query가 하나의 candidate slot을 선택할 수 있으므로, 전역 점수와 함께 사용해 장면 전체의 일관성을 보완한다.
계산량도 두 단계 검색 구조에서 관리된다. 모든 후보에 대해 객체 pair score를 계산하면 slot 수의 곱에 비례하는 비용이 생기지만, SceneBind는 전역 cosine으로 먼저 상위 50개만 남긴다. 그 뒤 텍스트 관련 검색에는 object score 가중치 0.5를, audio-visual 검색에는 0.05를 사용한다. 객체 위치가 자연어로 명시된 질의에서 slot 재순위가 더 큰 비중을 갖고, 모달리티 공유 정보가 상대적으로 적은 audio-visual 쌍에서는 전역 문맥을 우선하는 설정이다.
4. 실험 설정: 무엇과 어디를 함께 시험하는 데이터·평가 설계
SceneBind의 실험은 오디오·영상·텍스트 사이의 장면 검색, 의미가 같은 후보의 공간 검색과 객체 그라운딩, 과제별 학습 없는 오디오-비주얼 위치 추정으로 나뉜다. 실제 양이 녹음의 Binaural 말뭉치는 학습과 주 평가에, 360도 영상과 1차 앰비소닉 오디오의 Sphere360은 전방위 시점 변화에 대한 영점 학습 평가에만 사용한다.
4.1 Binaural 데이터가 만들어지는 과정
수집 파이프라인의 출발점은 공개 플랫폼에서 확보한 실제 환경 양이 오디오 영상 21,927개다. 먼저 가로형 영상, 너비 1,920픽셀 이상 또는 높이 1,080픽셀 이상, 유효한 양이 오디오, 비(非)360도 투영이라는 결정적 조건을 적용해 18,724개를 남긴다. 각 영상은 2초 단위 후보로 나뉘며, VGGish 특징으로 정보량이 낮은 음향 군집을 거르고 ImageBind 오디오-영상 유사도로 두 모달리티의 대응성을 확인한다. 여기에 주파수 가중 채널 간 레벨 차이와 채널 간 coherence로 양이 공간 단서의 강도를 계산한다. 음향 정보량, 오디오-영상 정렬, 양이 단서를 모두 통과한 짧은 구간은 이벤트 전후 맥락을 보존하도록 10초 주석 창으로 묶인다.
그다음 클립별 점수와 Bayesian Gaussian Mixture Model 기반 다양성 선택을 거쳐 8,015개 영상에서 10초 창 83,955개를 고른다. Gemini는 각 창을 초당 2프레임으로 입력받아 정확히 1초 또는 2초 길이의 원자적 이벤트를 제안한다. 프롬프트는 소리가 들리고 화면에도 원인이 보이는 audio_visual, 화면 밖에서 소리만 들리는 audio_only, 보이지만 소리가 동기화되지 않는 visual_only의 세 유형을 구분한다. 또한 audible event를 가능한 경우 가시 객체에 연결하고, 장면 설명과 객체별 의미 설명, 카메라 좌표계의 방위각·고도·거리 설명을 스키마가 고정된 JSON으로 출력하게 한다. 생성 온도는 0으로 고정한다. 이 단계에서 만들어진 2초 이벤트 후보는 381,556개다.
Gemini 제안은 곧바로 정답으로 채택되지 않는다. 각 이벤트에 대해 대표 프레임과 텍스트의 ImageBind 점수, 오디오와 텍스트의 CLAP 점수를 별도로 계산한다. audio_visual 제안은 ImageBind 점수가 0.10 이상이고 CLAP 점수가 0.05 이상일 때만 그대로 유지된다. 영상 조건만 통과하면 visual_only, 오디오 조건만 통과하면 audio_only로 낮춰 붙이고, 둘 다 실패하면 버린다. 원래 audio_only였던 이벤트는 CLAP 조건, visual_only였던 이벤트는 ImageBind 조건을 각각 통과해야 남는다. 검증 뒤 각 10초 후보에서 근거가 가장 강한 2초 이벤트 창을 하나 고르고, 그 창 안에서는 검증된 audio_visual 이벤트 라벨과 ImageBind 정렬이 가장 높은 프레임을 대표 이미지로 선택한다. 이 결과 최소 한 개의 검증된 audio_visual 이벤트가 있는 2초 클립 70,440개가 구성된다.
Table 2. Binaural 데이터 구축 funnel
| 단계 | 잔존 수 | 검증 의미 |
|---|---|---|
| 원본 영상 | 21,927 | 공개 플랫폼의 실제 바이노럴 영상 |
| 영상 필터 | 18,724 | 해상도·투영·오디오 조건 |
| 후보 선택 | 83,955 | 8,015개 영상의 10초 창 |
| 자동 주석 | 381,556 | 1~2초 사건 후보 |
| 교차모달 검증 | 70,440 | ImageBind·CLAP로 지지된 클립 |
| 최종 학습 | 38,430 | 공간·다양성 균형화 뒤 학습 split |
이 수열은 데이터 수집량보다 선별 규칙이 최종 표현의 범위를 결정한다는 사실을 보여 준다. 사건 후보의 약 18%만 교차모달 검증을 통과하고, 이후 공간·채널·의미 중복 균형화를 거쳐 학습 표본이 다시 줄어든다. 각 축소 단계는 노이즈를 낮추지만, 사전학습 encoder가 쉽게 맞히는 사례와 전방에 잘 보이는 사건이 상대적으로 더 많이 살아남을 가능성도 함께 만든다.
Figure 1: 원문 Figure 7. 원본 영상에서 교차모달 검증과 균형화까지의 데이터 funnel
원본 영상 21,927개에서 시작한 표본이 필터링·후보 선택·자동 주석·교차모달 검증을 통과하며 줄어드는 과정을 한 줄로 보여 준다. 특히 381,556개 사건 후보가 70,440개 검증 클립으로 줄어드는 구간은 생성 주석을 그대로 학습 정답으로 쓰지 않았음을 보여 주며, 마지막 38,430개는 공간과 다양성 균형화를 거친 실제 학습 규모다. 재현 시에는 각 단계의 threshold와 중복 제거 규칙을 함께 고정해야 같은 학습 분포를 얻을 수 있으며, 누락률도 단계별로 기록해야 한다.
최종 샘플 하나는 2초 양이 오디오, 대표 프레임 한 장, 전역 장면 설명, 여러 객체 절, 객체별 모달리티 유형과 공간 라벨을 묶는다. 전방 중앙으로 치우친 분포를 줄이기 위해 주 audio_visual 이벤트의 방위각이 0도인 클립은 50%만 유지한다. 이 공간 균형화 뒤 56,947개가 남는다. 이어 scene environment tag, event tag, YouTube channel에 걸친 반복을 줄이는 다양성 균형화를 학습 부분에 추가로 적용하며, 실제 SceneBind 학습에 쓰인 최종 Binaural 학습 세트는 38,430개 클립과 207,836개 객체다. 따라서 56,947은 공간 균형화까지 끝난 공개 Binaural 집합의 크기이고, 38,430은 split 이후 학습 부분을 다시 다양성 균형화한 크기라는 점을 구분해야 한다.
Figure 2: 원문 Figure 6. Binaural 데이터의 장면 태그와 의미 사건 군집 분포
위쪽 순위-빈도 곡선은 장면 태그 2,834개와 의미 군집 13,653개가 긴 꼬리를 이룬다는 점을 보여 준다. 아래 막대그래프에서는 street·beach·park 같은 환경과 walking·standing·waves crashing·parked car 같은 사건이 상위에 나타난다. 데이터가 다양한 동시에 자주 등장하는 도시·교통·행동 범주에 학습 신호가 집중될 수 있음을 함께 읽어야 한다. 긴 꼬리 군집의 별도 성능을 보고하면 전체 평균이 가리는 희귀 사건 coverage를 더 정확히 확인할 수 있다.
4.2 공간 라벨 공간과 데이터 분할
공간 라벨은 연속 3차원 좌표 대신 카메라 기준의 구간 분류다. 방위각은 hard left [-90도, -60도), left [-60도, -30도), slight left [-30도, -15도), front [-15도, 15도], slight right (15도, 30도], right (30도, 60도], hard right (60도, 90도]의 7개 bin이다. 고도는 high above [30도, 90도], above [10도, 30도), level [-10도, 10도], below [-30도, -10도), down below [-90도, -30도)의 5개 bin을 쓴다. 거리는 touching 또는 very close [0, 1.5)m, close [1.5, 5)m, medium [5, 10)m, far [10m, 무한대)의 4개 bin이다. 객체 절에는 방향어를 제외한 의미 설명과 객체 이름을 제외한 공간 설명이 따로 존재하고, 둘을 결합한 자연어 설명도 함께 저장된다.
Binaural 자료는 원본 영상 단위로 80% 학습, 5% 검증, 15% 테스트로 나눈다. 즉 같은 원본 영상에서 잘라낸 2초 창이 서로 다른 split으로 흩어지지 않게 한다. 분할 시 채널과 의미 군집을 기준으로 층화해 분포 차이와 학습-테스트 누출 가능성을 줄인다. 테스트용 Binaural benchmark와 Sphere360 benchmark에는 네 명의 검토자가 각각 독립적으로 사람 검수를 수행한다. 대표 이미지, 양이 오디오, 장면 설명, 객체 절, 공간 라벨을 함께 보고 오디오-영상 대응이 약한 샘플, 객체나 이벤트가 모호한 샘플, 영상·음향 품질이 낮거나 의미 있는 이벤트가 없는 샘플을 제거한다. 남은 객체의 방위각·고도·거리 라벨은 필요하면 수정하고, 의미 또는 공간적으로 유일하게 식별되지 않는 객체는 삭제한다. 거의 같은 이미지·오디오·텍스트를 가진 클립도 하나만 남기되 이벤트 명료도와 객체 품질, 의미·공간 다양성이 높은 쪽을 우선한다.
Figure 3: 원문 Figure 10. benchmark 후보의 사람 검수 화면
검수자는 대표 프레임과 바이노럴 오디오를 재생하면서 장면 설명, 객체 절, 방향·고도·거리 라벨을 한 화면에서 확인한다. 인터페이스는 clip 폐기와 객체별 라벨 수정 기능을 제공해 자동 주석의 오류를 평가 세트에서 줄인다. 다만 논문이 보고한 네 명 검수는 benchmark 품질을 높이는 절차이며, 전체 학습 클립을 같은 강도로 재주석했다는 의미는 아니다. 검수자 간 합의율과 수정 이력이 함께 공개되면 평가 라벨의 불확실성과 사람 검수의 실제 기여를 더 투명하게 측정할 수 있다.
이 데이터의 측정 범위도 실험 설정에 포함해 읽어야 한다. Binaural의 최초 공간 라벨은 양이 신호에서 삼각측량한 좌표 대신 Gemini가 시각 증거를 바탕으로 제안한 카메라 좌표 bin이며, Gemini 자체는 양이 공간 단서를 직접 지각하지 않는다. ImageBind와 CLAP 검증은 객체 설명이 프레임과 오디오에 의미적으로 지지되는지를 검사하지만, 방위각·고도·거리의 물리적 정확도를 독립 센서로 측정하는 절차는 아니다. 사람 검수는 평가 benchmark에 추가되지만 전체 38,430개 학습 클립을 모두 수동 재주석한 것으로 보고되지는 않는다. 네 검토자의 평가자 간 일치도와 최종 의견 불일치 조정 통계도 논문에 제시되지 않는다.
누출 통제의 기본 단위는 영상이며 채널은 층화와 다양성 균형화 변수다. 따라서 동일 영상의 창 중복은 split으로 차단하지만, 동일 채널의 촬영 스타일이나 유사 환경까지 완전히 분리한 channel-disjoint split은 아니다. 평가 후보의 근접 중복은 사람 검수에서 추가로 제거한다. 또 데이터 선택 과정에 ImageBind와 CLAP가 사용되고 비교 모델에도 ImageBind 및 CLAP 계열이 포함되므로, benchmark가 이 사전학습 표현들이 높은 유사도를 부여한 사례 쪽으로 선택되는 구성 의존성이 존재한다. 이는 정답을 직접 학습한 누출이 확인됐다는 뜻은 아니며, 논문이 보고한 선택 절차와 baseline backbone 사이의 중첩을 구분해 기록한 것이다. 이러한 한계가 결과 해석에 미치는 의미는 8절에서 별도로 다룬다.
4.3 Binaural과 Sphere360 benchmark의 query pool
사람 검수를 마친 Binaural benchmark는 1,066개 클립이다. 모든 클립에 각 모달리티에 유효한 객체가 있는 것은 아니어서 장면 검색의 후보 pool은 과제마다 다르다. audio-visual pool은 1,040쌍, audio-text pool은 942개, visual-text pool은 1,046개다. 일반 audio-visual 검색은 1,040개 paired sample 모두를 query로 쓴다. 텍스트 기반 검색은 단일 객체만 있는 쉬운 장면을 제외한다. audio-text query는 audio_visual과 audio_only를 합친 오디오 관련 객체가 두 개 이상이어야 하고, visual-text query는 audio_visual과 visual_only를 합친 시각 관련 객체가 두 개 이상이어야 한다. 이 필터 뒤 실제 query 수는 audio-text 325개, visual-text 757개다. 후보 pool 크기와 query 수를 같은 숫자로 오해하면 안 된다.
공간 검색은 객체 수준 텍스트 절에서 시작한다. 같은 의미 군집 안에 양자화된 방위각·고도·거리 조합이 일치하는 양성 샘플이 최소 하나 있고, hard pool 크기가 미리 정한 범위인 5개에서 20개 사이인 query만 남긴다. 오디오 관련 query 745개와 시각 관련 query 782개, 총 1,527개가 구성된다. spatial mAP는 장면 검색과 같은 전체 retrieval pool을 순위화하며 세 공간 bin이 모두 맞는 샘플을 양성으로 본다. spatial-hard R@1은 동일 의미 군집 안에서 공간 배치만 다른 hard pool에 범위를 좁히고, 각 고유 공간 bin당 후보를 최대 하나만 둔다. hard pool 평균 크기는 11.75, 중앙값은 10이다. 객체 그라운딩은 1,066개 클립의 모든 모달리티 관련 객체를 사용하며, audio_visual과 audio_only에서 1,386개 오디오 target, audio_visual과 visual_only에서 2,682개 시각 target을 평가한다.
Sphere360은 Binaural과 역할이 다르다. 360도 영상의 FOA 신호를 시점 방향에 맞게 회전하고 MIT KEMAR HRTF로 양이 오디오를 디코딩한다. 각 장면에서 90도 간격의 네 투시 영상을 만들고, 주 시점 주변의 yaw 0도, ±30도, ±60도 보조 시점까지 이용한 세 단계 주석 절차로 객체를 교차 확인한다. 최종 hard benchmark는 97개 클립과 4,277개 객체, 그중 audio_visual 객체 553개로 구성된다. query 객체는 방위각 [-90도, 90도]의 전방 사례로 제한하고 후보는 같은 장면의 증강된 360도 시점에서 뽑는다. 의미가 같고 공간 배치만 다른 후보 pool의 평균 크기는 45.4, 중앙값은 47이며, 이 집합은 학습에 넣지 않고 영점 학습 공간 구별에만 사용한다.
Table 3. 평가 pool과 query 규모
| 과제 | 후보 pool | query/target | 핵심 통제 |
|---|---|---|---|
| A↔V 장면 검색 | 1,040 | 1,040 query | paired sample 전체 |
| A↔T 장면 검색 | 942 | 325 query | 오디오 관련 객체 2개 이상 |
| V↔T 장면 검색 | 1,046 | 757 query | 시각 관련 객체 2개 이상 |
| Binaural 공간 검색 | 전체 pool / hard 5~20 | 1,527 query | 동일 의미 안의 공간 조합 구분 |
| Binaural grounding | 1,066 clip | 오디오 1,386 / 시각 2,682 | 객체별 의미와 3개 공간 속성 |
| Sphere360 hard | 평균 45.4 | 97 clip, 4,277 object | 동일 의미·변경된 시점의 zero-shot 평가 |
과제마다 후보 수와 query 필터가 달라서 평균 점수만 비교하면 난도를 오해하기 쉽다. 특히 텍스트 검색은 복수 객체를 가진 장면만 남기고, 공간 검색은 같은 의미 군집 안에서 위치 조합만 바뀌는 hard pool을 사용한다. Sphere360은 학습에 넣지 않은 360도 장면으로 구성되어, 의미 단서를 통제한 상태에서 공간 구별이 유지되는지를 따로 검사한다.
4.4 베이스라인의 범위와 공정성 통제
비교군은 AudioCLIP, SpatialCLAP, LAION-CLAP, M2D-CLAP, ImageBind다. CLAP 계열 오디오 encoder에는 SigLIP2의 영상·텍스트 encoder를 짝지으며, AudioCLIP과 ImageBind는 자체 encoder를 사용한다. 사전학습 모델의 영점 학습 평가는 각 모델의 native text encoder와 audio-visual chained scoring을 따른다. 이 모델들은 샘플당 전역 embedding 하나만 내므로, 논문은 이를 confidence 1.0인 단일 object slot으로 간주해 객체 절을 각각 매칭하고 유사도를 집계한다. 방위각·고도·거리를 구조화해 예측하는 head가 없기 때문에 공간 조건 텍스트에서는 의미와 공간 표현을 합친 객체 절 하나를 embedding해 샘플 embedding과 직접 비교한다.
새 데이터 적응 효과를 분리하려고 ImageBind*, M2D-CLAP*+SigLIP2*, SpatialCLAP*+SigLIP2*도 비교한다. 별표 모델은 SceneBind와 같은 Binaural·AudioCaps·MS-COCO, split, 2단계 일정과 retrieval pool을 쓴다. backbone과 기존 alignment module은 동결하고 projection head를 학습한다. 전역 audio-visual, audio-text, visual-text 대칭 InfoNCE와 여러 객체 절을 모두 양성으로 보는 multi-positive clip-to-clause 손실을 적용한다. 같은 데이터 접근성과 최적화 예산은 통제하지만, baseline에는 별도 공간 분류 head가 없고 SceneBind의 object-centric slot과 공간 decoder는 구조적 차이로 남는다.
4.5 학습 레시피와 하이퍼파라미터
SceneBind는 두 단계로 총 60 epoch 학습한다. 1단계는 Binaural 38,430개, AudioCaps 91,254개, MS-COCO 118,248개를 30 epoch 섞어 전역 의미 정렬과 객체·공간 학습을 함께 수행한다. 데이터셋 i의 sampling 확률은 크기 n_i의 제곱근과 가중치 w_i의 곱에 비례한다. Binaural 가중치는 2.0으로 sample 비율 54.8%, AudioCaps와 MS-COCO 가중치는 각각 0.5로 비율은 21.1%와 24.1%다. AudioCaps는 audio-text 의미 감독, MS-COCO는 visual-text 의미 감독을 제공하며 MS-COCO의 부분 공간 라벨에서는 방위각과 고도만 사용한다. 2단계는 1단계 weight에서 시작하되 optimizer를 재설정하고, Binaural만 100% sampling해 30 epoch 추가 학습한다.
두 단계 모두 AdamW, weight decay 0.01, cosine learning-rate decay, gradient norm 1.0 clipping을 사용한다. 1단계 learning rate는 $1\times10^{-4}$, warmup 200 step, global batch size 1,024이고, 2단계는 $5\times10^{-5}$, warmup 100 step, global batch size 512다. 학습은 140GB 메모리의 NVIDIA H200 GPU 8장이 장착된 단일 node에서 수행되며 GPU process마다 data-loading worker 8개를 둔다. 논문이 보고한 두 단계 전체 wall-clock time은 약 4시간이다. 동일 데이터로 미세조정한 별표 baseline도 30+30 epoch, 같은 batch size, optimizer, learning rate, warmup, decay와 clipping 일정을 적용받는다.
Table 4. 2단계 학습 레시피
| 설정 | Stage 1 | Stage 2 |
|---|---|---|
| 데이터 | Binaural + AudioCaps + MS-COCO | Binaural만 사용 |
| epoch | 30 | 30 |
| global batch | 1,024 | 512 |
| learning rate | $1\times10^{-4}$ | $5\times10^{-5}$ |
| warmup | 200 step | 100 step |
| optimizer | AdamW, weight decay 0.01 | optimizer 재설정, 같은 decay |
| compute | 8× H200 140GB | 두 단계 합계 약 4시간 |
두 단계의 목적은 의미 데이터 규모와 공간 감독의 농도를 시간순으로 분리하는 데 있다. 1단계에서 AudioCaps와 MS-COCO가 공통 의미 공간을 넓히고, 2단계에서 Binaural만 사용해 방위각·고도·거리 신호가 희석되지 않도록 한다. 베이스라인 별표 모델에도 같은 30+30 epoch 일정과 데이터 접근성을 부여해 단순한 추가 학습량의 차이를 줄였다.
4.6 평가 지표
장면 검색은 A↔V, A↔T, V↔T의 양방향 Recall@1을 보고한다. 각 query의 정답 장면이 전체 후보 순위 1위에 놓인 비율이며, 양방향 값을 과제별로 집계한다. 공간 검색의 mAP는 전체 후보에서 동일 의미와 올바른 양자화 공간 라벨을 가진 복수 양성이 얼마나 위쪽에 정렬되는지를 평균 정밀도로 측정한다. spatial-hard R@1은 같은 의미 군집의 다른 공간 구성만 모은 hard pool에서 정답이 1위인지 본다. 두 지표는 의미 검색 능력과 미세 공간 구별 능력을 서로 다른 후보 구성으로 측정한다.
객체 그라운딩에서는 공간 표현을 제거한 query 의미 설명을 predicted slot과 비교한다. confidence와 의미 유사도가 가장 높은 slot을 고르며 의미 유사도 0.5를 넘는 비율을 recall로 보고한다. accuracy는 그 조건과 함께 방위각 7-bin, 고도 5-bin, 거리 4-bin이 모두 맞는 비율이며 속성별 accuracy도 제시한다. 영점 학습 오디오-비주얼 위치 추정은 과제별 fine-tuning 없이 sounding region을 만든다. 예측 heatmap과 ground-truth bounding-box mask의 overlap을 cIoU로 측정하고 0.2, 0.3, 0.4 같은 threshold별 결과와 전 구간 AUC를 보고한다. 구현에서는 heatmap을 정규화해 0.4로 이진화하고, 여러 연결 성분 중 audio-visual guide map의 지지가 가장 강한 성분을 남긴다.
4.7 재현과 비교에서 고정해야 할 평가 조건
장면 검색 수치는 후보 pool과 query filter를 함께 고정해야 재현할 수 있다. $A\leftrightarrow V$는 paired sample 1,040개 전체를 질의로 쓰지만, 텍스트 검색은 모달리티 관련 객체가 두 개 이상인 장면만 남겨 query 수가 325개와 757개로 줄어든다. 전체 후보 수를 query 수로 착각하거나 단일 객체 장면을 다시 포함하면 Recall@1의 난도가 바뀐다. 논문의 평균은 세 모달리티 쌍의 양방향 수치를 모은 값이므로 어느 한 방향만 계산한 결과와 직접 비교하면 안 된다.
공간 검색의 두 지표도 서로 다른 질문에 답한다. spatial mAP는 전체 retrieval pool에서 의미와 양자화 공간 라벨이 모두 맞는 복수 양성이 상단에 모이는지를 평가한다. spatial-hard R@1은 의미 군집을 고정하고 각 공간 bin 조합당 후보를 최대 하나만 남긴 작은 pool에서 1위를 찾는다. 전자는 실제 대규모 검색의 정밀도와 관련되고, 후자는 의미 단서가 같은 상황에서 위치만으로 구별하는 능력에 가깝다. 두 수치 중 하나만 보고 모델의 공간 민감성을 단정하면 후보 구성의 영향을 놓친다.
grounding accuracy는 의미 유사도 0.5를 넘긴 객체 slot이 방위각·고도·거리 세 속성까지 모두 맞혀야 하는 엄격한 교집합 지표다. 속성별 정확도는 어떤 센서 단서가 유리한지를 보여 주지만, 세 값을 곱해 전체 정확도를 예측할 수는 없다. 같은 slot을 선택하는 과정과 속성 오류 사이에 상관이 있고 각 bin의 빈도도 균등하지 않기 때문이다. 재현 보고에는 semantic recall, 전체 accuracy, 세 속성별 accuracy를 함께 제시해야 의미 회수 실패와 위치 분류 실패를 분리할 수 있다.
zero-shot localization은 추가 weight 학습이 없다는 조건과 전용 추론 절차가 존재한다는 조건을 동시에 기록해야 한다. global visual attention, audio-visual guide, slot의 방위각·고도 일치, 거리별 Gaussian 폭, heatmap threshold와 연결 성분 선택이 최종 mask에 모두 관여한다. 표현 비교를 위해서는 이 hyperparameter를 baseline에도 동일하게 적용하거나, 단순한 linear probe와 구조화 decoder를 별도 행으로 나누는 것이 안전하다. 그래야 SceneBind encoder가 제공한 이득과 hand-designed spatial projection이 제공한 이득을 구분할 수 있다.
5. 주요 실험 결과: 전역 의미와 공간 구조가 함께 만든 검색 이득
SceneBind의 첫 번째 검증 축은 미관측 Binaural 테스트 세트의 양방향 장면 검색이다. $A\leftrightarrow V$ Recall@1은 21.8, $A\leftrightarrow T$는 17.0, $V\leftrightarrow T$는 65.3이며 세 쌍의 평균은 34.7이다. 강한 미세조정 베이스라인과 비교하면 $A\leftrightarrow V$는 19.3에서 21.8로 2.5%포인트, $A\leftrightarrow T$는 11.2에서 17.0으로 5.8%포인트 높다. 특히 $V\leftrightarrow T$ 65.3은 사전학습 최고 51.2보다 14.1%포인트 높아, 객체 절과 공간 조건을 전역 벡터에만 압축하지 않은 설계의 이득을 보여 준다.
공간 검색에서는 차이가 더 커진다. 같은 의미 군집 안에서 위치 구성이 다른 후보를 구분하는 spatial R@1에서 SceneBind는 28.9, 정답 공간 라벨을 가진 후보의 순위를 보는 mAP에서는 48.0을 기록했다. 최고 베이스라인은 각각 11.4와 29.6이므로 절대 차이는 17.5%포인트와 18.4%포인트다. 공간 속성을 자연어 문장에 넣어 전역 대조학습을 하는 것만으로는 같은 객체가 어느 방향·고도·거리에 있는지 분리하기 어렵고, 그 세 분포를 객체 슬롯에 귀속한 효과가 가장 직접적으로 드러난다.
Table 5. Binaural 장면·공간 검색 결과
| 모델 | A↔V | A↔T | V↔T | Scene Avg | Spatial R@1 | Spatial mAP |
|---|---|---|---|---|---|---|
| ImageBind | 7.8 | 7.6 | 48.0 | 21.2 | 10.6 | 28.7 |
| M2D-CLAP+SigLIP2 | 0.3 | 9.0 | 51.2 | 20.2 | 11.4 | 29.6 |
| M2D-CLAP*+SigLIP2* | 19.3 | 11.2 | 42.8 | 24.4 | 10.1 | 28.9 |
| SpatialCLAP*+SigLIP2* | 16.1 | 9.3 | 44.2 | 23.2 | 10.6 | 29.2 |
| SceneBind | 21.8 | 17.0 | 65.3 | 34.7 | 28.9 | 48.0 |
동일 데이터 미세조정이 모든 전역 모델에 균등한 이득을 주지는 않는다. M2D-CLAP+SigLIP2는 오디오 관련 검색이 크게 좋아졌지만 시각-텍스트는 51.2에서 42.8로 낮아졌다. 하나의 벡터가 장면 문맥과 복수 객체 위치를 동시에 맡을 때 특정 모달리티 쌍의 적응이 다른 쌍의 구조를 흔들 수 있음을 시사한다. SceneBind는 빠른 전역 점수를 유지하면서 객체 수준 점수를 재순위화에만 더해 이 상충을 완화한다.
Figure 4: 원문 Figure 11. 파도 소리 질의에 대한 오디오→영상 검색
질의 오디오는 해변의 파도와 해안선 방향을 포함하고, SceneBind는 정답 영상을 1위로 올린다. ImageBind의 정답 순위는 44위, 동일 데이터로 미세조정한 M2D-SigLIP2의 정답 순위는 7위다. 세 방법 모두 해변이라는 전역 의미는 포착하지만, SceneBind의 객체 슬롯은 파도가 정면에 가깝고 중거리라는 공간 조건을 후보 레이아웃과 함께 비교한다. 오른쪽의 grounded slot 표는 의미 유사도와 confidence가 어떤 객체를 재순위 근거로 사용했는지도 사례별로 확인하게 해 준다.
Figure 5: 원문 Figure 12. 강바닥과 차량 위치를 포함한 텍스트→영상 검색
텍스트 질의는 오른쪽의 바위 강바닥과 왼쪽 도로의 차량을 서로 다른 거리 조건으로 묘사한다. SceneBind의 상위 세 후보는 강·도로라는 장면 문맥과 두 객체의 상대 배치를 함께 보존한다. ImageBind는 세부 질의에 둔감한 장면을 고르고, M2D-SigLIP2는 차량 단서를 놓치므로 객체 절을 공간 슬롯과 연결한 재순위화의 역할이 드러난다. 같은 river 범주 안에서도 강바닥·차량·도로의 상대 배치를 따로 점검하기 때문에 전역 의미가 비슷한 오답을 아래로 밀 수 있다.
5.1 객체 그라운딩과 모달리티별 공간 단서
텍스트 객체 절로 해당 객체 슬롯과 세 공간 속성을 모두 맞히는 grounding의 전체 정확도는 오디오 20.1%, 시각 19.1%다. 오디오는 방위각 39.4, 좌우 62.7, 고도 83.2, 거리 58.4이고 시각은 각각 35.5, 67.1, 76.1, 66.1이다. 바이노럴 위상·레벨 차이는 방위와 고도에 도움을 주고, 영상의 원근과 물체 크기는 거리 구분을 보완하는 패턴이다. 다만 전체 정확도가 약 20%라는 사실은 의미 회수와 세 속성의 동시 정답이 여전히 어렵다는 뜻이며, 고도 83.2도 연속 각도 오차와는 다른 5개 구간 분류 정확도다.
Table 6. 객체 그라운딩의 속성별 정확도
| 모달리티 | 전체 | 방위각 | 좌우 | 고도 | 거리 |
|---|---|---|---|---|---|
| 오디오 | 20.1 | 39.4 | 62.7 | 83.2 | 58.4 |
| 시각 | 19.1 | 35.5 | 67.1 | 76.1 | 66.1 |
서로 다른 모달리티가 같은 공간 속성에서 같은 강점을 보이지 않는다는 점이 중요하다. 오디오는 방위각과 고도에서, 시각은 좌우 대분류와 거리에서 상대적으로 높다. 이는 세 감각을 한 벡터로 평균내는 것보다, 객체 단위에서 서로 다른 증거를 비교하고 결합할 구조가 필요한 이유를 수치로 뒷받침한다.
5.2 의미가 통제된 Sphere360과 zero-shot 전이
Sphere360 hard pool에서는 의미가 같은 장면을 시점과 공간 배치만 바꾸어 비교한다. SceneBind는 AV 25.7, VT 32.0, AT 30.1, 평균 29.3을 얻어 가장 강한 미세조정 평균 18.8보다 10.5%포인트 높다. AT는 기존 최고 10.2에서 30.1로 19.9%포인트 증가해, 텍스트의 위치 조건과 회전된 공간 오디오를 직접 결박하는 능력이 크게 기여했다. 이 평가는 97개 클립에서 파생된 hard pool이므로 광범위한 현실 도메인 이동 전체를 대변하지는 않지만, 의미 유사도가 공간 신호를 가리는 문제를 분리해 보여 준다.
Table 7. Sphere360 zero-shot hard-pool 검색
| 모델 | AV | VT | AT | 평균 |
|---|---|---|---|---|
| ImageBind* | 23.3 | 22.8 | 10.2 | 18.8 |
| SpatialCLAP*+SigLIP2* | 19.4 | 19.9 | 9.7 | 16.3 |
| SceneBind | 25.7 | 32.0 | 30.1 | 29.3 |
egocentric 오디오-비주얼 위치 추정에서도 과제별 weight fine-tuning 없이 SceneBind는 cIoU@0.2/0.3/0.4에서 52.65/33.73/19.47, AUC 24.39를 기록한다. 이전 AVLoc은 38.71/19.42/10.51과 AUC 18.38이므로 모든 threshold에서 앞선다. 다만 이 수치는 표현만 바꾼 단순 probe보다 구조화된 온도 조정, 가우시안 공간 guide, 연결 성분 선택을 포함한 전용 추론 절차의 결과다.
Table 8. zero-shot AV localization
| 방법 | cIoU@0.2 | cIoU@0.3 | cIoU@0.4 | AUC |
|---|---|---|---|---|
| AVLoc | 38.71 | 19.42 | 10.51 | 18.38 |
| SceneBind (Binaural만) | 43.94 | 26.34 | 13.91 | 20.80 |
| SceneBind | 52.65 | 33.73 | 19.47 | 24.39 |
5.3 수치를 모달리티 정보량과 함께 읽는 법
$V\leftrightarrow T$ 65.3과 $A\leftrightarrow V$ 21.8의 격차는 encoder 품질만으로 설명되지 않는다. 텍스트 설명은 영상에서 보이는 복수 객체와 배경을 직접 언급할 수 있지만, 오디오는 소리를 내는 일부 객체만 관측하고 화면 밖 사건도 포함한다. 영상에는 조용한 건물·도로·식생이 많이 남아 있어 오디오와 공유되지 않는 정보가 크다. 따라서 세 모달리티 쌍의 절대값을 같은 난도의 지표처럼 비교하기보다, 각 쌍의 최고 baseline 대비 이득과 후보 pool의 관측 가능성을 함께 봐야 한다.
Audio↔Text의 상승 폭이 큰 이유도 텍스트 객체 절의 구조와 관련된다. 장면 설명 하나를 전역 오디오 벡터에 맞추면 여러 음원과 화면 밖 사건이 한 문장으로 섞이지만, SceneBind는 audio_visual과 audio_only 객체를 분리해 각 slot의 의미와 공간 분포를 비교한다. 텍스트에 방향·고도·거리 조건이 들어가면 object score 가중치가 0.5로 커져 전역 의미가 비슷한 후보를 다시 가른다. 반면 Audio↔Visual의 object score 가중치는 0.05여서 두 센서가 공유하지 않는 객체가 과도한 벌점으로 작동하는 것을 줄인다.
Sphere360의 AT 30.1은 이 메커니즘을 가장 깨끗하게 보여 주지만 범위도 분명하다. 후보들은 같은 360도 원본 장면에서 시점과 FOA 회전을 바꾸어 만들어 의미 내용이 매우 유사하고, query는 전방 객체로 제한된다. 이 조건은 공간 구별에 초점을 맞추는 장점이 있으나, 새로운 방·다른 녹음 장치·다른 화자의 HRTF로 이동하는 일반화를 검증하지 않는다. 실제 배포 성능을 예측하려면 의미가 통제된 내부 반사실 평가와 센서·환경이 바뀌는 외부 domain shift 평가를 별도로 구성해야 한다.
grounding의 속성별 숫자에서는 bin 폭과 분포를 확인해야 한다. level 고도 bin은 [-10도, 10도]이고 거리의 far bin은 10m 이상 전체를 포함하므로, 클래스 비율이 높으면 세밀한 추정 없이도 accuracy가 올라갈 수 있다. 논문은 전체 정확도와 속성별 accuracy를 함께 보고하지만 class-balanced accuracy, 각도 MAE, 거리 calibration 곡선은 제시하지 않는다. 이후 비교에서는 인접 bin 오차에 작은 비용을 주는 ordinal metric과 연속 센서 정답의 오차를 함께 넣는 편이 공간 표현의 정밀도를 더 잘 드러낸다.
zero-shot localization은 검색 표현이 dense region proposal로 전이될 수 있음을 보여 주는 보조 증거다. global semantic attention이 소리 날 가능성이 있는 영역을 넓게 제안하고, slot의 의미·방위각·고도 일치가 후보 영역을 좁힌다. Binaural만 학습한 모델이 AVLoc을 넘고 다중 소스 학습이 다시 AUC를 높인 결과는 의미 데이터와 공간 데이터의 상보성을 지지한다. 다만 bounding-box mask의 cIoU는 음원 중심의 연속 좌표나 다중 음원의 분리 성능을 직접 측정하지 않으므로, point localization과 source-count 평가를 추가해야 전이 범위를 더 정확히 알 수 있다.
6. 추가 분석 및 Ablation Study: 어떤 손실과 매칭 규칙이 공간 정보를 만든다
6.1 손실 항의 역할 분해
손실 절제는 전역 장면 검색과 객체 수준 공간 표현 사이의 긴장을 보여 준다. 모든 손실을 쓰면 Scene 34.7, Spatial 38.4, Grounding 19.6이다. 객체 의미 손실을 제거하고 intra-scene과 batch 대조만 남기면 Scene은 36.0으로 오르지만 Grounding은 8.8로 절반 이하가 된다. 객체 절과 슬롯을 직접 결박하는 감독이 없으면 전역 상관은 유지해도 질의한 객체의 위치를 회수하지 못한다.
Table 9. 학습 목적함수 절제
| $\mathcal{L}_{sem}$ | $\mathcal{L}_{inst}$ | $\mathcal{L}_{batch}$ | Scene | Spatial | Ground |
|---|---|---|---|---|---|
| ✓ | ✓ | — | 35.5 | 36.5 | 19.6 |
| ✓ | — | ✓ | 34.3 | 31.1 | 16.1 |
| — | ✓ | ✓ | 36.0 | 35.2 | 8.8 |
| ✓ | ✓ | ✓ | 34.7 | 38.4 | 19.6 |
intra-scene 손실을 빼면 Spatial이 38.4에서 31.1로 7.3%포인트 떨어져 같은 장면 안의 공존 객체를 분리하는 압력이 중요함을 보여 준다. batch 손실을 빼면 Grounding은 유지되지만 Spatial이 36.5로 낮아져, 장면을 넘어 같은 의미의 다른 위치를 구별하는 판별력이 약해진다. 전체 조합은 Scene 단독 최고값을 조금 포기하고 공간 검색 최고값과 grounding 공동 최고값을 얻는 균형점이다.
6.2 Global+Slot과 confidence의 상보성
Table 10. SceneBind Matching 절제
| 전략 | AV | T→A/V | A/V→T | Spatial |
|---|---|---|---|---|
| Global | 21.3 | 36.1 | 34.2 | 25.4 |
| Global+Slot | 21.8 | 42.4 | 39.9 | 38.4 |
| Slot-only Best match | 11.5 | 18.6 | 17.3 | 38.4 |
| Slot-only Hungarian | 10.9 | 21.1 | 6.9 | 38.4 |
| Slot-only, confidence 없음 | 9.5 | 22.8 | 15.7 | 38.4 |
Global만 쓸 때 Spatial은 25.4지만 Global+Slot은 38.4로 13.0%포인트 높다. 반대로 Slot-only best match는 Spatial 38.4를 유지하면서 AV 장면 검색이 11.5로 내려가므로 전체 문맥을 보존하는 전역 벡터가 여전히 필요하다. 학습의 Hungarian assignment를 추론에도 강제하면 예측 슬롯과 텍스트 절의 객체 수 불일치에 취약하고, confidence를 빼면 저품질 슬롯이 예측 대상 검색을 오염시킨다. 따라서 전역 문맥, 독립 best match, confidence 가중치가 서로 다른 실패 모드를 막는다.
Figure 6: 원문 Figure 13. 이동하는 버스 음원에 대한 오디오→영상 검색
이동 버스의 엔진음은 짧은 2초 구간에서도 위치가 변해 하나의 확정 좌표로 표현하기 어렵다. SceneBind는 버스 엔진과 관련된 복수 슬롯에 서로 다른 공간 가설을 남기고, 전역 도로 문맥과 함께 정답 영상을 1위로 찾는다. 이 사례는 다중 슬롯이 움직임의 불확실성을 포괄할 수 있음을 보여 주는 동시에, 시간 ID가 없는 정적 슬롯이 궤적을 여러 객체처럼 복제할 수 있다는 한계도 드러낸다. 따라서 이 그림의 복수 엔진 슬롯은 곧바로 다중 음원 탐지 성공으로 해석하기보다 이동 음원의 여러 위치 가설로 보는 편이 정확하다.
6.3 데이터 일정과 슬롯 수
Binaural만 학습하면 Scene 33.8, Spatial 35.2, Grounding 19.5다. All→Binaural은 34.7/38.4/19.6으로 특히 Spatial을 3.2%포인트 높이고, All→All은 35.2/36.5/19.9로 의미와 grounding은 조금 높지만 공간 구별은 낮다. 광범위한 의미 정렬을 먼저 학습한 뒤 마지막 단계에서 공간 라벨의 농도를 높이는 일정이 공간 검색에 가장 유리하다. 슬롯 수는 약 10개를 넘으면 대부분 포화하고, 시각은 약 25개, 오디오는 약 5개 부근에서 정점을 보인다. 구현의 K=50은 localization 후보 포괄률까지 고려한 보수적 상한이어서 검색만 목표로 할 때는 계산량을 줄일 여지가 있다.
Figure 7: 원문 Figure 14. 악기와 위치를 포함한 텍스트→오디오 검색
질의는 재즈 트리오와 색소폰·베이스·드럼의 상대 방향과 거리를 함께 지정한다. SceneBind는 정답 오디오를 1위에 놓고, 상위 후보에서도 유사한 공연 맥락과 스펙트로그램 구조를 보존한다. 전역 공연 의미만 맞추는 검색보다 악기별 슬롯의 방향·거리 일치가 재순위에 관여하므로, 텍스트가 여러 객체를 분해해 서술할 때 객체 중심 표현의 이득이 커진다. 특히 색소폰·베이스·드럼처럼 의미가 가깝고 동시에 울리는 사건에서 악기별 방향 조건이 candidate audio를 구분하는 추가 단서가 된다.
Figure 8: 원문 Figure 15. 차량이 있는 거리 영상→오디오 검색
거리 영상 질의에서 SceneBind의 정답 오디오는 2위이며, 1위 후보도 전방 차량과 거리 음향이라는 의미·공간 조건이 가깝다. ImageBind와 M2D-SigLIP2의 정답 순위는 각각 44위와 12위다. 영상에는 소리를 내지 않는 객체가 많고 오디오에는 화면 밖 사건이 섞이므로 완전한 1대1 대응이 어렵지만, 객체 슬롯은 어떤 차량 단서가 실제 오디오 후보와 공유되는지를 분리해 비교한다. 이 사례는 단일 정답 순위와 별개로 의미·공간적으로 타당한 대체 오디오가 존재하므로, graded relevance 평가가 필요한 이유도 보여 준다.
6.4 슬롯 포화와 정성 사례가 드러내는 오류 구조
슬롯 수 증가 곡선은 표현 용량과 검색 잡음의 trade-off를 보여 준다. 평균적인 장면 검색과 grounding은 약 10개 이후 포화하며, 시각은 한 프레임에 존재하는 객체 수가 많아 약 25개, 오디오는 동시에 활성화되는 사건 수가 적어 약 5개 부근에서 정점을 보인다. K=50은 예외적으로 복잡한 장면과 localization 후보를 넉넉히 담지만, 활성 confidence가 낮은 중복 슬롯도 함께 만든다. 실제 시스템에서는 query 유형과 예상 객체 밀도에 따라 slot budget을 동적으로 조절하고, latency·memory·정확도 곡선을 같이 보고하는 편이 합리적이다.
정성 검색은 top-1 성공만 보여 주기보다 global score와 object score가 순위를 어떻게 바꾸는지 확인하는 데 가치가 있다. 해변 사례에서는 세 모델이 모두 beach 의미를 찾지만 SceneBind만 파도와 해안선의 방향·거리 배치를 보존한다. 재즈 사례에서는 악기별 slot이 텍스트와 오디오를 연결하고, 거리 영상 사례에서는 정답이 2위여도 1위 후보가 전방 차량 음향이라는 가까운 대체답이다. 단일 ground-truth 순위는 현실 장면의 복수 타당 후보를 오답으로 처리할 수 있으므로, 사람 판정 relevance와 spatial consistency를 별도 등급으로 수집할 필요가 있다.
이동 버스 예시는 다중 가설을 남기는 장점과 시간 모델 부재를 동시에 보여 준다. 여러 엔진 관련 slot이 각기 다른 방위와 거리를 예측하면 순간적인 불확실성은 포괄하지만, 같은 물체가 이동한 것인지 여러 버스가 있는지 표현 자체에서 구별할 수 없다. 다음 ablation은 slot 간 temporal association을 켠 경우와 끈 경우를 비교하고, 정적 검색·궤적 추적·음원 수 추정 세 지표를 함께 측정해야 한다. 이런 평가는 단순히 K를 늘려 성능을 맞추는 전략과 실제 객체 지속성을 학습하는 전략을 분리한다.
7. 한계점 및 향후 연구 방향: 공간 라벨·시간축·센서 이동의 빈틈
가장 큰 한계는 공간 라벨의 생성 경로다. Binaural 학습 데이터는 38,430개로 웹 규모 의미 데이터보다 작고, 자동 주석에 쓰인 Gemini는 바이노럴 단서를 직접 지각하지 못한다. 방위각·고도·거리는 주로 시각 증거에서 추정되므로 보이는 객체와 카메라 전방을 과대표집하고, 화면 밖이나 후방 음원을 누락할 수 있다. ImageBind와 CLAP 검증은 의미 지지를 확인하지만 물리 좌표를 독립 센서로 측정하지는 않는다.
시간 표현도 짧다. 단일 프레임과 약 2초 오디오를 정적 슬롯 집합으로 만들기 때문에 이동 차량의 궤적, 접근과 이탈, 발화자 교대, 가려졌다 다시 나타나는 음원을 동일 ID로 추적하지 못한다. 슬롯 탄생·소멸과 카메라 운동을 명시하지 않으면 긴 구간에서 한 음원이 위치가 다른 여러 슬롯으로 복제될 수 있다. temporal slot과 motion-aware matching이 다음 확장에 필요한 이유다.
공간 해상도는 방위각 7, 고도 5, 거리 4개 구간이다. 인접 bin과 반대 방향의 오류가 같은 오답으로 처리되고, 고도 83.2 같은 큰 값도 연속 각도·미터 오차를 뜻하지 않는다. HRTF 개인차, 잔향, 마이크 간격, 카메라 내부 파라미터 변화에 대한 강건성 표가 없으며, Sphere360은 같은 영상에서 만든 시점 증강이므로 실제 장치와 환경 변화 전체를 포괄하지 않는다.
zero-shot localization은 weight fine-tuning은 없지만 정규화 카메라 투영, 공간 logit 온도, 거리별 Gaussian 폭, heatmap threshold와 연결 성분 선택을 포함한다. slot confidence도 활성 객체 확률로 학습됐을 뿐 도메인 밖 입력의 교정된 불확실성으로 검증되지는 않았다. ECE·Brier score·선택적 예측을 추가해야 로봇이나 보조기기처럼 오판 비용이 큰 환경에서 confidence를 행동 결정에 사용할 수 있다.
공간 오디오와 영상에서 사람·행동·사적 환경의 위치를 함께 추론하는 기술은 비동의 감시와 맥락 추정에 전용될 수 있다. 동의 기반 수집, 민감 신호 최소화, 비공개 공간 사용 제한, 원시 데이터 보존 기간 통제와 실패 표시가 모델 성능과 함께 평가되어야 한다. 논문의 broader impact도 같은 위험을 명시하며, 실제 배포에서는 거친 위치 구간을 확정적 좌표처럼 사용하지 않는 정책이 필요하다.
- 센서로 독립 측정한 연속 방위·고도·거리 정답을 추가한다.
- 동일 영상에서 FOA/HRTF만 회전시키는 반사실 평가로 시각 복사 여부를 분리한다.
- 시간 ID를 유지하는 temporal slot으로 이동 음원과 객체 궤적을 추적한다.
- HRTF·잔향·마이크·카메라 변화에서 domain shift와 uncertainty calibration을 함께 측정한다.
7.1 운영 환경에서 필요한 추가 검증 묶음
실내 로봇에 SceneBind를 붙일 때는 검색 benchmark의 평균 점수보다 실패 비용을 먼저 정의해야 한다. 전방의 사람과 뒤쪽 경고음을 혼동하는 오류, 가까운 장애물을 먼 대상으로 분류하는 오류, 소리 없는 화면 객체를 활성 음원으로 고르는 오류는 같은 top-1 실패라도 위험도가 다르다. 방위·고도·거리 confusion matrix에 행동 비용을 결합하고, confidence가 낮을 때 이동을 멈추거나 사람 확인을 요청하는 selective policy를 평가해야 한다. 이때 coverage를 높일수록 risk가 어떻게 변하는지 곡선으로 보고하면 slot confidence가 실제 의사결정에 쓸 수 있는지 판단할 수 있다.
센서 변화 검증은 학습에 없는 HRTF, 마이크 간격, 잔향 시간, 카메라 시야각을 직교 요인으로 나누어야 한다. 한 번에 모든 조건을 바꾸면 성능 하락의 원인을 찾기 어렵다. 동일 장면의 FOA 원음에서 HRTF만 교체하고, 같은 HRTF에서 잔향과 신호대잡음비만 바꾸는 식의 factorial design을 쓰면 오디오 공간 branch가 어떤 물리 단서에 의존하는지 드러난다. 영상에서는 crop·수평 반전·카메라 회전과 좌표 라벨을 함께 변환해 semantic invariance와 spatial equivariance를 따로 측정할 수 있다.
데이터 거버넌스도 성능 평가와 분리할 수 없다. 공개 플랫폼의 영상에서 사람·차량·실내 대화의 위치를 추정하는 모델을 만들 때는 원본 수집 근거, 삭제 요청 처리, 민감 음성 최소화, 파생 annotation의 보존 기간을 기록해야 한다. multimodal-data-supply-chain 개념에서 다뤘듯 모델 카드만으로는 원시 신호와 자동 주석의 계보를 복원하기 어렵다. 각 학습 clip이 어떤 원본, 필터, Gemini proposal, ImageBind·CLAP 검증, 사람 수정 단계를 거쳤는지 provenance를 남기면 오류 분석과 삭제 전파를 함께 수행할 수 있다.
마지막으로 실시간성 검증에는 전역 1차 검색과 slot 재순위 비용을 분리해 보고해야 한다. 후보가 커질수록 전역 embedding 검색은 vector index로 확장할 수 있지만, 상위 50개 후보의 K×K slot 비교는 K와 요청량에 따라 지연이 늘어난다. K=50 고정, 동적 slot pruning, 모달리티별 최적 slot budget을 비교하고 recall·spatial mAP·latency·memory를 같은 표에 두면 운영자가 품질과 비용의 절충점을 선택할 수 있다. 이 측정은 object-centric 구조의 이득이 실제 배포에서도 유지되는지를 확인하는 마지막 조건이다.
8. 내 해석: 시각 중심 공간 정답을 반사실 센서 평가로 분리하기
내가 가장 걸리는 약점은 공간 정답이 독립된 음향 측정값보다 Gemini의 시각 추정에 크게 기대고 있다는 점이다. 모델은 좌우 magnitude·phase에서 바이노럴 단서를 배우지만, 그 단서를 채점하는 방위각·고도·거리는 보이는 객체와 전방 장면에 치우칠 수 있다. 그 결과 오디오 공간 성능이 실제 음원 기하 회복과 시각적 위치 라벨 재현을 동시에 반영해 주장에 부분적인 순환성이 생긴다. 이전에 리뷰한 MemEye가 시각 중심 평가의 증거 보존 문제를 드러냈듯, 삼중 모달 정렬에서도 한 모달리티가 정답 생성과 검증을 함께 지배하면 다른 모달리티의 고유 정보가 과소평가되거나 잘못 보상될 수 있다.
내가 확장한다면 counterfactual benchmark를 먼저 붙이겠다. 같은 영상에 FOA 원음을 회전하거나 개인별 HRTF로 렌더링한 바이노럴 음장을 붙여 시각 의미는 고정하고 음향 방향만 바꾸고, 반대로 음장은 고정한 채 시각 객체 위치를 이동한다. 마이크 배열·카메라 calibration·depth sensor에서 얻은 geometry를 독립 정답으로 삼고, 이동 음원은 identity를 유지하는 temporal slot으로 추적한다. 각 변형에서 공간 분포의 calibration error와 selective risk를 함께 측정하면 모델이 영상 위치를 복사하는지, 실제 음향 변화에 맞춰 예측을 뒤집는지, 모순 상황에서 confidence를 낮추는지를 분리해 판정할 수 있다.
9. 결론: 객체별 의미와 공간 분포를 공통 장면 인터페이스로
SceneBind는 전역 의미 임베딩 위에 객체별 의미·방위각·고도·거리·confidence를 얹어, 오디오·영상·언어가 같은 장면을 무엇과 어디의 조합으로 비교하게 한다. Binaural 검색에서 장면 평균 Recall@1 34.7, spatial R@1 28.9, spatial mAP 48.0을 기록했고, 의미가 통제된 Sphere360 hard pool에서도 평균 29.3으로 최고 미세조정 기준 18.8을 넘었다. grounding 전체 정확도는 오디오 20.1%와 시각 19.1%로 아직 낮지만, 속성별 분포와 zero-shot localization 결과는 같은 표현을 여러 공간 과제에 재사용할 수 있음을 보여 준다.
절제 실험은 성능 향상의 경로를 좁혀 준다. 객체 의미 손실은 grounding, intra-scene 대조는 공존 객체 분리, batch 대조는 장면 간 공간 판별, Global+Slot 결합은 전체 문맥과 세부 배치의 균형을 맡는다. All→Binaural 일정은 대규모 의미 감독 뒤에 공간 감독의 농도를 회복하는 학습 원리도 보여 준다. 다음 검증은 센서로 독립 측정한 연속 기하, 반사실 모달 충돌, 장시간 객체 궤적, HRTF·잔향·장치 변화와 교정된 불확실성에서 같은 이득이 유지되는지를 확인해야 한다.
10. 요약 정리: SceneBind를 읽고 남겨야 할 열 가지
- SceneBind는 장면 전체의 global embedding과 K=50 object-centric semantic-spatial slot을 함께 출력한다.
- 각 slot은 객체 의미, 방위각 7구간, 고도 5구간, 거리 4구간의 분포, 활성 confidence를 포함한다.
- 시각·텍스트는 SigLIP2, 오디오 의미는 M2D-CLAP, 오디오 공간은 바이노럴 STFT branch에서 추출한다.
- 이분 매칭과 객체 grounding, intra-scene·cross-scene contrastive loss가 순서 없는 slot을 객체 절과 결박한다.
- Binaural 학습 데이터는 21,927개 원본 영상에서 검증·균형화를 거쳐 38,430개 학습 클립으로 정제된다.
- Binaural 결과는 Scene 평균 34.7, spatial R@1 28.9, mAP 48.0이며 Sphere360 hard pool 평균은 29.3이다.
- Global+Slot은 Global-only보다 Spatial 지표를 25.4에서 38.4로 높이지만 Slot-only는 장면 문맥을 잃는다.
- 객체 grounding 전체 정확도는 약 20%이고 공간 라벨이 시각 중심 자동 주석에서 시작한다는 한계가 남는다.
- 후속 평가는 FOA/HRTF와 센서 geometry를 이용한 반사실 benchmark, temporal slot, uncertainty calibration을 결합해야 한다.