
UniNote:통합 멀티모달 임베딩
Xiaohongshu의 UniNote가 텍스트, 이미지, 오디오, 비디오를 하나의 공유 임베딩 공간에 매핑하여 검색, 랭킹, 탐색을 통합하는 방식을 알아보세요.
Xiaohongshu의 핵심 아이디어는 간단합니다. 하나의 노트, 하나의 임베딩, 하나의 검색 경로입니다. 텍스트, 이미지, 비디오, 오디오를 별도 시스템에서 처리하는 대신 UniNote는 검색과 랭킹 모두를 위해 이들을 하나의 공유 벡터 공간에 배치합니다.
이 글에서 제가 가장 중요하다고 본 내용을 추리면 다음과 같습니다.
- UniNote는 노트마다 하나의 멀티모달 임베딩을 생성합니다
- InfoNCE 손실과 하드 네거티브 마이닝을 포함한 2단계 학습을 사용합니다
- 검색과 랭킹에 동일한 임베딩 시스템을 사용하는 것을 목표로 합니다
- 사진을 상품 페이지나 비디오 클립과 매칭하는 것처럼 크로스모달 검색의 성능을 높이는 것이 목표입니다
- 관련 공유 공간 연구에서 인용한 NDCG@10 최대 26%포인트 향상을 비롯해 크로스모달 검색 성능 개선을 제시합니다
- 한계도 분명합니다. 세밀한 불일치, 3~25초로 제한되는 비디오 시간 구간, 신호가 서로 맞지 않을 때 발생하는 랭킹 오류가 있습니다
다시 말해, 이 접근법은 또 하나의 모델을 추가하는 것보다 미디어 유형별로 분리된 파이프라인을 줄이는 데 더 가깝습니다. 검색, 피드, 쇼핑 탐색을 개발하는 팀에는 하나의 인덱스, 더 단순한 시스템 흐름, 검색과 랭킹 사이의 불일치 감소를 의미할 수 있습니다.
제가 얻은 결론은 명확합니다. 공유 임베딩은 멀티모달 검색 운영을 단순화할 수 있지만, 결과가 제대로 느껴지는지는 여전히 정렬 품질에 달려 있습니다.
Qwen3-VL-Embedding과 Qwen3-VL-Reranker:최첨단 멀티모달 검색을 위한 통합 프레임워크

UniNote의 작동 방식:아키텍처, 학습, 검색·랭킹 설계


모달리티 전반의 통합 노트 표현
UniNote는 먼저 ASR, OCR, VLM을 사용해 오디오, 이미지, 비디오를 공유 노트 형식으로 변환한 다음, 이러한 신호를 하나의 공통 벡터 공간에 매핑합니다. 각 모달리티는 자체 인코더를 거치고, 학습 가능한 프로젝션 레이어가 그 출력을 하나의 고차원 공간으로 옮깁니다. 최종 결과는 노트에 포함된 모든 신호를 바탕으로 만든 노트당 하나의 임베딩입니다.
이 구성 덕분에 Xiaohongshu는 텍스트, 이미지, 비디오, 오디오 검색에 하나의 파이프라인을 사용할 수 있습니다. 각 형식을 서로 떨어진 섬처럼 다루지 않고 같은 지도 위에 배치하는 셈입니다.
물론 모델이 형식 간 강력한 정렬을 학습해야만 가능한 일입니다.
2단계 학습과 하드 네거티브 마이닝
UniNote는 2단계 접근법을 사용합니다.
첫 번째 단계에서는 InfoNCE 손실을 이용한 대조 학습을 적용합니다. 이를 통해 서로 다른 형식으로 나타난 콘텐츠라도 서로 일치하면 더 가까이 끌어오도록 모델을 학습합니다.
두 번째 단계에서는 관련성 인식 최적화와 하드 네거티브 마이닝을 통해 랭킹 품질에 집중합니다. 하드 네거티브는 맥락상 비슷해 보이지만 의미상으로는 틀린 항목입니다. 이는 매우 중요합니다. 모델이 거의 맞는 항목과 실제로 일치하는 항목을 구분할 수 있다면 랭킹이 더 정교해집니다.
UniNote는 가변 길이 임베딩도 사용합니다. 작업에 최고 수준의 정밀도가 필요하지 않을 때 임베딩 길이를 줄일 수 있다는 뜻입니다. 쉽게 말해, 시스템은 세부 정보를 조금 줄이는 대신 저장 공간을 절약하고 검색 속도를 높일 수 있습니다.
그러면 동일한 임베딩이 후보 검색과 최종 랭킹을 모두 처리할 수 있습니다.
검색과 랭킹에 하나의 모델을 사용하면 시스템 설계가 단순해지는 이유
많은 추천 시스템은 검색에 한 모델, 랭킹에 다른 모델을 사용합니다. 이론상으로는 깔끔해 보입니다. 하지만 실제로는 단계 간 드리프트가 생겨 한 모델은 관련성을 한 방식으로 학습하고 다른 모델은 조금 다른 방식으로 학습할 수 있습니다.
UniNote는 이러한 분리를 피합니다. 검색과 랭킹 모두에 하나의 임베딩 프레임워크를 사용하여 두 단계를 서로 정렬된 상태로 유지합니다. 이 공유 구성이 프로덕션 환경에서 검색과 랭킹이 같은 방식으로 작동하도록 돕습니다.
다음으로 살펴볼 질문은 이 설계가 실제 검색 작업에서 얼마나 뛰어난 성능을 내느냐입니다.
연구 결과:작업, 성능, 현재의 한계
항목 간 검색 작업과 벤치마크 범위
UniNote는 항목 간 검색 작업에서 테스트되었습니다. 쉽게 말해 모델이 하나의 공유 임베딩 공간 안에서 서로 다른 형식의 동일하거나 관련된 콘텐츠를 매칭하는 작업입니다.
핵심 테스트는 매우 간단합니다. 하나의 임베딩이 별도 파이프라인을 거치지 않고 형식 간 콘텐츠를 연결할 수 있을까요? 이는 처음 생각하는 것보다 더 중요합니다. 동일한 임베딩이 두 가지 역할을 수행해야 하기 때문입니다. 모달리티 간 의미를 온전히 유지하면서 검색과 랭킹을 모두 지원해야 합니다.
크로스모달 검색 전반의 성능 향상
UniNote는 검색 벤치마크에서 각 모달리티에 별도 파이프라인을 사용하지 않고 하나의 공유 공간으로 매칭 품질을 높일 수 있는지 테스트합니다. 공유 임베딩 공간에서 클러스터의 중심을 다시 맞추는 GR-CLIP은 표준 CLIP과 비교해 NDCG@10을 최대 26%포인트 향상시켰습니다[1].
이는 작은 상승 폭이 아닙니다. 검색 시스템에서는 랭킹 지표가 조금만 움직여도 후속 추천 결과가 눈에 띄게 달라질 수 있습니다.
하지만 공짜로 얻는 것은 없습니다. 이러한 개선에는 절충이 따릅니다.
통합 임베딩이 여전히 부족한 부분
모달리티가 깔끔하게 맞아떨어지지 않을 때 통합 임베딩은 여전히 어려움을 겪습니다. 이 경우 시스템이 결과의 순위를 잘못 매기거나 환각처럼 느껴지는 오류를 만들 수 있습니다. 특히 시각 신호와 텍스트 신호가 서로 다른 방향을 가리킬 때 세밀한 콘텐츠에서 성능이 떨어질 수도 있습니다.
비디오도 또 다른 난제입니다. 많은 시스템이 여전히 3~25초의 시간적 맥락만 처리하므로 활용할 수 있는 시퀀스 수준의 의미에 명확한 상한이 생깁니다.
이는 혼합 형식 콘텐츠를 대규모로 처리하는 빠르게 변화하는 검색 및 추천 시스템에서 더 큰 문제가 됩니다.
검색, 추천, 멀티모달 AI 워크플로의 실용적 활용 사례
이러한 검색 성능 향상은 프로덕션에서 검색과 추천을 더 쉽게 운영할 수 있을 때만 의미가 있습니다.
소셜 커머스와 미디어를 위한 크로스모달 검색 및 추천
UniNote 방식 임베딩의 주요 사용 사례는 상품 탐색과 콘텐츠 매칭입니다. 통합 임베딩 시스템을 사용하면 하나의 쿼리로 쇼핑객의 사진을 상품 목록, 크리에이터 리뷰, 짧은 비디오와 매칭할 수 있으며, 팀이 형식마다 별도 파이프라인을 구축할 필요가 없습니다.
이는 소셜 커머스와 미디어에서 매우 중요합니다. 사용자는 스크린샷을 업로드하거나 캡션을 붙여 넣거나 상품명으로 검색할 수 있습니다. 이러한 입력이 모두 같은 임베딩 공간에 있다면 시스템이 텍스트, 이미지, 비디오 전반에서 관련 항목을 반환할 가능성이 훨씬 커집니다.
추천에도 도움이 됩니다. 관련 게시물, 캡션, 클립이 충분히 가까운 위치에 유지되므로 더 촘촘한 콘텐츠 클러스터링과 더 나은 피드 추천을 지원할 수 있습니다. 운영 측면에서도 팀은 여러 개가 아닌 하나의 인덱스를 유지할 수 있어 부가적인 구성 요소를 크게 줄일 수 있습니다.
멀티모달 인덱싱, 지연 시간, 인프라 고려 사항
통합 임베딩 모델로 전환하면 인덱싱 방식이 직접적으로 바뀝니다. 텍스트, 이미지, 비디오를 위한 별도의 벡터 저장소를 운영하는 대신 하나의 근사 최근접 이웃(ANN) 인덱스로 통합할 수 있습니다. 쿼리 라우팅이 단순해지고 운영 오버헤드도 줄어듭니다.
비디오는 또 다른 요소를 더합니다. 팀은 검색 속도를 늦추지 않으면서 타이밍 신호를 온전히 보존하는 전처리 과정이 필요합니다. 실제로는 대개 다음을 의미합니다.
- 프레임 샘플링
- 동일한 멀티모달 파이프라인으로 클립 인코딩
- 프로덕션 사용에 충분히 빠른 검색 속도 유지
이 구성은 모델 통합 오버헤드도 줄입니다. 텍스트용 경로, 이미지용 경로, 비디오용 경로를 각각 연결할 필요가 없습니다. 파이프라인이 더 단순해지고, 이는 대개 향후 유지보수 부담의 감소로 이어집니다.
APIMart가 통합 멀티모달 워크플로에 적합한 방식

APIMart는 하나의 OpenAI 호환 엔드포인트(api.apimart.ai/v1)를 통해 텍스트, 이미지, 비디오 모델을 제공합니다. 이를 통해 계약, 인증, 속도 제한 관련 오버헤드를 줄일 수 있습니다.
멀티모달 워크플로를 구축하는 팀은 배관 작업을 매번 다시 작성하지 않고 하나의 통합 레이어로 여러 모델 유형을 처리할 수 있습니다. 엔지니어링의 초점을 API 관리가 아닌 임베딩 로직과 비즈니스 로직에 유지할 수 있습니다.
개발자와 AI 팀을 위한 핵심 요점
UniNote에서 얻을 수 있는 교훈
검색 및 인프라의 세부 내용을 살펴본 뒤 얻을 수 있는 핵심 결론은 운영 측면에 있습니다. UniNote는 하나의 의미 공간을 사용해 멀티모달 검색과 랭킹을 처리합니다. 별도 파이프라인은 규모가 커질수록 일관성 없는 결과를 만들기 쉬우므로 이는 중요합니다.
쉽게 말해 모달리티 간 전달 과정과 랭킹 불일치가 줄어듭니다. 개발자 입장에서는 크로스모달 검색의 구성 요소가 감소한다는 의미입니다. 상품 이미지를 설명과 매칭하고, 짧은 비디오를 캡션과 연결하며, 소셜 커머스용 멀티모달 검색을 실행하는 모든 작업이 더 단순해집니다. 형식마다 별도 모델을 이어 붙이지 않고 동일한 임베딩이 검색과 랭킹을 모두 처리하기 때문입니다.
실용적인 방향은 명확합니다. 하나의 공유 의미 공간을 중심으로 인덱싱, 검색, 추천을 구축하면 파이프라인을 다시 만들지 않고도 새로운 모달리티를 연결할 수 있습니다. 하나의 인덱스, 하나의 랭킹 로직, 더 적은 통합 지점.
자주 묻는 질문
혼합 미디어에서 하나의 임베딩은 어떻게 만들어지나요?
UniNote와 유사한 시스템은 텍스트, 이미지, 비디오, 오디오를 하나의 공유 의미 벡터 공간에 매핑하여 단일 임베딩을 생성합니다.
일반적으로 트랜스포머 기반 모델을 사용해 각 입력 유형을 하나의 통합 표현으로 변환합니다. 그런 다음 크로스모달 어텐션과 프로젝션 레이어를 사용하여 형식이 달라도 동일한 개념이 서로 정렬되도록 합니다. 이를 통해 시스템은 서로 다른 미디어 유형 사이의 의미적 유사도를 측정할 수 있습니다.
검색과 랭킹에 같은 임베딩을 사용하는 이유는 무엇인가요?
검색과 랭킹에 동일한 임베딩을 사용하면 모든 요소가 하나의 공유 의미 공간에 유지됩니다. 이는 처음 보기보다 더 중요합니다.
텍스트, 이미지, 비디오를 같은 방식으로 매핑하면 직접 비교할 수 있습니다. 텍스트 쿼리를 이미지와 정렬할 수 있고, 비디오를 텍스트 설명과 매칭할 수 있습니다. 관련 콘텐츠는 형식에 따라 서로 멀어지지 않고 계속 동기화된 상태를 유지합니다.
그 결과 크로스모달 검색 성능이 향상되고, 모달리티 격차가 줄어들며, 추천 파이프라인이 안정적이고 일관되게 유지됩니다.
현재 UniNote의 가장 큰 한계는 무엇인가요?
UniNote는 텍스트, 이미지, 비디오, 오디오를 하나의 공유 의미 공간에 배치하려 할 때 가장 큰 한계에 부딪힙니다. 이론적으로는 깔끔해 보입니다. 하지만 실제로 이러한 모달리티는 저절로 정렬되지 않으므로 학습이 더 어려워지고 학습된 표현이 약해질 수 있습니다.
공동 학습 중에는 모달리티 편향 또는 충돌이라는 또 다른 문제도 있습니다. 쉽게 말해 모델이 가장 쉬운 입력에 지나치게 의존하고 다른 입력에는 충분한 주의를 기울이지 않을 수 있습니다. 그 결과 일부 모달리티가 충분히 학습되지 않을 수 있습니다. 실제 데이터에서 오디오가 누락되는 식으로 입력이 불완전하면 문제는 더 심해집니다. 모델의 전반적인 성능이 떨어지거나 우연히 가장 강한 하나의 모달리티에 지나치게 의존할 수 있습니다.
모델 마켓에서 원하는 모델을 선택하세요
APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.