← Blog
KRAFTON · 연구 프리뷰

Raon-VisionEncoder
Raon을 위한 비전 인코더

Raon에 '눈'을 달기 위해 SigLIP2급 비전 인코더를 오픈 데이터만으로 처음부터 만들어낸 이야기입니다.

미션: Raon에 눈을 달아주세요

이 프로젝트는 KRAFTON AI의 Raon에 세상을 이해하는 '눈'을 달기 위해 시작되었습니다. 모델이 텍스트 너머의 세상과 대화하려면, 이미지를 정밀하게 이해하는 강력한 비전 인코더가 필수입니다. 우리의 목표는 현존하는 최고 수준의 비전 인코더인 Google의 SigLIP2[1]를 재현하는 것이었습니다.

💡 Raon-VisionEncoder 프로젝트의 목표: 오픈 데이터만으로, SigLIP2급 비전 인코더를 처음부터 학습하고, 그 전체 과정을 공개하는 것.

목표는 SigLIP2, 그런데 레시피에 빠진 재료들

SigLIP2는 제로샷 분류, 검색, 세그멘테이션, 그라운딩 등 광범위한 비전 벤치마크에서 최정상급 성능을 보여주는 모델입니다. 학습 파이프라인은 3단계로 잘 정리되어 있었습니다. 1단계에서 대조 학습과 LocCa[3] 로스로 기본기를 다지고, 2단계에서 자기 지도 학습(SILC[8], TIPS[9])으로 밀도 높은 특징을 배우고, 3단계에서 NaFlex[14]로 다양한 해상도에 적응하는 구조입니다.

문제는 레시피는 있었지만, 핵심 재료가 빠져 있었습니다.

없는 것 1: 10B 스케일의 학습 데이터

SigLIP2는 Google의 비공개 데이터셋인 WebLI[2]로 학습됩니다. 100억 장 규모의 이미지-텍스트 쌍인데, 우리에게는 접근 자체가 불가능했습니다. 오직 공개 데이터만으로 이 규모를 채워야 했습니다.

없는 것 2: 그라운딩 데이터

SigLIP2의 LocCa 디코더는 이미지 속 특정 영역을 바운딩 박스로 지시하고 설명하는 능력을 학습합니다. 이를 위해 SigLIP2는 OWL-ViT[4]라는 대규모 객체 탐지기를 전체 학습 데이터에 돌려서 수십억 개의 의사(pseudo) 어노테이션을 생성합니다. H200 GPU 8장으로 추산하면 150일 이상이 걸리는 작업으로, 엄청난 컴퓨트 자원을 필요로 합니다.

없는 것 3: 학습 코드

SigLIP2의 논문은 학습 레시피를 상세히 기술하고 있지만, 학습 코드 자체는 공개되어 있지 않습니다. 3단계 학습 파이프라인, 다양한 로스 함수의 조합, NaFlex 해상도 적응까지 — 논문의 설명을 바탕으로 처음부터 구현해야 했습니다.

재료 준비: 107억 장의 데이터 풀을 모으다

SigLIP2 학습에 사용된 WebLI 데이터는 구성 방식이 공개되지 않아 직접 활용이 어려웠습니다. 이에 대한 대안으로, 대규모 데이터 확보 및 큐레이션 파이프라인이 공개된 MetaCLIP[5]의 방식을 참조하기로 결정했습니다.

데이터 풀은 LAION-400M (2.8억)[6]과 DataComp-1B (14억)[7]를 기반으로 구성하였으며, 부족한 데이터를 채우기 위해 Common Crawl 웹 아카이브를 직접 처리했습니다. 2017년부터 2026년까지 총 42개 스냅샷에서 이미지-텍스트 쌍을 추출하였고, 그 규모는 90억 장에 달했습니다.

90억 장 규모의 이미지를 다운로드하고 처리하는 일은, 나이브하게 접근하면 그것만으로 수십일을 통째로 소모할 수 있는 작업이었습니다. 데이터를 받기도 전에 프로젝트가 끝나버리는 상황을 막기 위해, 수많은 엔지니어링 문제를 하나씩 풀어가야 했습니다. 이를 위해 효율화된 파이프라인을 구축하였고, 56대의 머신을 약 10일간 가동하여 약 90억 장의 추가 이미지를 확보했습니다.

총 107억장의 데이터 풀을 구성한 뒤 고품질 학습 데이터를 선별하기 위해 MetaCLIP 밸런싱 기법과 CLIP 점수 기반 필터링을 적용하여 전체 풀에서 유의미한 데이터를 추출하는 큐레이션 과정을 거쳤습니다.

Data Pipeline Overview
10.7B 데이터 풀
42 Snapshots · 2017–2026
Common Crawl
~9B
오픈 소스
DataComp-1B
1.4B
오픈 소스
LAION-400M
280M
🧠
CLIP Embedding 추출
🔍
중복 제거
🛡️
안전 필터링
⚖️
MetaCLIP 밸런싱
📊
CLIP 랭킹
10.7B
996M
최종 학습 세트 데이터 풀

그라운딩 데이터: 양이 아닌 질로 승부

SigLIP2의 수십억 건 의사 어노테이션을 재현할 수 없었기에, 발상을 전환했습니다. OpenImages[16], Objects365[17], Visual Genome[18] 등 공개 데이터셋에서 사람이 직접 만든 고품질 어노테이션을 수집하고, GranD[15] 데이터셋의 모델 생성 어노테이션을 더해 총 1,720만 건의 그라운딩 데이터를 조합했습니다. SigLIP2의 수십억 건에 비하면 극히 작은 규모이지만, 어노테이션의 품질로 승부하겠다는 전략이었습니다.

Grounding Data · SigLIP2 vs Ours

SigLIP2

~10B
의사 어노테이션 (pseudo labels)
  • OWL-ViT 탐지기로 전체 학습 데이터에서 자동 생성
  • H200 8장 기준 150일+ 소요
  • 탐지기 성능에 의해 품질이 제한됨

Raon-VisionEncoder

17.2M
고품질 오픈소스 어노테이션
  • 사람이 직접 만든 GT 어노테이션 중심
  • 별도 GPU 컴퓨트 불필요
  • 고품질 그라운딩 데이터

레시피를 넘어: 우리가 추가한 것들

SigLIP2의 레시피를 충실히 재현하는 것에 그치지 않고, 세 가지 핵심 개선점을 도입했습니다.

3-Phase Training Pipeline
Phase 1
Contrastive + LocCa
Sigmoid 대조 학습
캡셔닝 + 그라운딩
Phase 2
+ Self-Supervised + Regularizer NEW
+ 자기 증류
+ 마스크 예측
+ GramNEW
+ KoLeo Reg.NEW
Phase 3
NaFlex Resolution     
가변 시퀀스 학습
Modification 1
별도 그라운딩 배치
대조학습과 분리된 공간 학습
Modification 2
Gram + KoLeo
DINOv2/v3 정규화 추가
Modification 3
Muon Optimizer
AdamW 대비 ~2배 샘플 효율

별도 그라운딩 배치 구성

SigLIP2는 모든 학습 이미지에 의사 어노테이션이 있어 전체 배치가 모든 태스크에 참여합니다. 우리는 별도 소스의 그라운딩 데이터를 사용하므로, 배치의 일부를 그라운딩 전용 샘플로 구성하는 혼합 배치 전략을 도입했습니다. 그라운딩 샘플은 참조 표현 예측과 그라운디드 캡셔닝만 수행하고, 대조 학습에서는 제외됩니다.

Gram Anchoring과 KoLeo 정규화

SigLIP2의 자기 지도 학습 목표(SILC[8], TIPS[9])는 DINO 계열의 방법론에서 파생된 것이지만, 전역적인 특징 상관 구조를 보존하거나 임베딩 공간의 모드 붕괴를 방지하는 장치가 빠져 있었습니다. 이를 보완하기 위해 DINOv3[11]의 Gram Anchoring (Phase 1에서 학습된 특징 상관 구조 보존)과 DINOv2[10]의 KoLeo 정규화[13] (임베딩 공간의 균일한 커버리지 유지)를 Phase 2에 추가했습니다.

Muon 옵티마이저

SigLIP2의 AdamW 대신 Muon 옵티마이저[12]를 채택했습니다. Muon은 Adam 대비 약 2배의 샘플 효율성이 보고된 바 있어, 10배 적은 데이터로 학습해야 하는 우리 상황에 안성맞춤이었습니다. Ablation 실험에서 AdamW 대비 ImageNet +2.83, 그라운딩 +2.75의 일관된 향상을 확인했습니다.

SigLIP2 (원본)

  • 옵티마이저: AdamW
  • Phase 2 정규화: —
  • 그라운딩: OWL-ViT 의사 어노테이션 (100억 샘플)
  • 학습 데이터: WebLI (비공개, 100억 샘플)

Raon-VisionEncoder (Ours)

  • 옵티마이저: Muon (~2× 효율)
  • Phase 2 정규화: Gram + KoLeo
  • 그라운딩: 오픈소스 고품질 (1,720만 샘플)
  • 학습 데이터: 오픈소스 (10억 샘플)

결과: SigLIP2 턱밑까지

B200 GPU 80장으로 약 2주간 학습한 최종 모델의 결과입니다. 10배 적은 데이터, 오직 공개 데이터만으로 학습했음에도, 여러 벤치마크에서 SigLIP2에 필적하거나 능가하는 성과를 거두었습니다.

Benchmark Results
Raon-VisionEncoder (오픈 데이터)
SigLIP2-NaFlex (비공개 데이터)
🏆 SigLIP2 초과
+2.12
Seg mIoU 우위
≈ 17.2M vs 수십억
Grounding
훨씬 작은 데이터로
동등 수준의 성능
≈ 동등
Retrieval
검색 태스크
동등 수준의 성능
🏆 영어 → 한국어
KO ≈
영어 전용 학습으로
한국어 VLM 동등
Gap 남음
~5%pt
ImageNet 분류
데이터 스케일 차이

밀도 높은 예측: SigLIP2 초과

밀도 높은 예측(Dense Prediction) 태스크에서 Raon-VisionEncoder가 가장 빛났습니다. Pascal VOC 세그멘테이션에서 +2.12 mIoU, 깊이 추정에서 δ₁ +2.70으로 SigLIP2-NaFlex를 상회했습니다.

그라운딩: 1,720만 샘플로 수십억에 대항

그라운딩에서 SigLIP2와 동등 수준(AVG 75.40 vs 75.78)을 달성했습니다. RefCOCO 4개 split에서 SigLIP2를 상회하며, 1,720만 건의 고품질 오픈소스 그라운딩 데이터가 SigLIP2의 전체 100억 장 학습 데이터에서 생성한 OWL-ViT 의사 어노테이션에 견줄 수 있음을 보여줍니다.

분류와 검색: 여전한 간극, 하지만 의미 있는 출발

제로샷 분류에서는 SigLIP2 대비 약 5포인트의 격차가 남아있습니다. 이는 학습 데이터의 절대적 차이(10억 vs 100억 샘플)와 비공개 WebLI 데이터의 품질 차이가 반영된 결과로, 예상 범위 내의 결과입니다. 검색(Retrieval)에서도 COCO I2T R@1 기준 약 3포인트의 차이가 있지만, Flickr30K에서는 SigLIP2-NaFlex와 동등한 수준을 달성했습니다.

VLM 평가: 영어 전용 학습으로도 한국어까지

LLaVA-OneVision-1.5 Quick-start 프로토콜 하에서 비전 인코더의 VLM 다운스트림 성능을 평가했습니다. 영어 벤치마크에서는 MMMU(45.89 vs 43.44), RealWorldQA(66.14 vs 64.97), CV-Bench(70.90 vs 70.74), AI2D(75.00 vs 74.90)에서 SigLIP2를 앞섰고, ChartQA(71.12 vs 71.48)에서도 거의 동등한 수준을 보였습니다. 특이한 점은 한국어 벤치마크입니다. 영어 전용 데이터로 학습했음에도 KRETA(49.28 vs 48.04), K-VisCUIT(63.47 vs 62.40), DTCBench(43.75 vs 43.75)에서 다국어 데이터로 학습한 SigLIP2와 동등하거나 우위를 기록했습니다.

돌아보며, 그리고 앞으로

프로젝트 기간 동안 인프라 세팅부터 데이터 다운로드·큐레이션, ablation 실험, 최종 모델 학습까지 전 과정을 완성했습니다. 이 프로젝트가 남긴 것은 단순한 체크포인트 하나가 아닙니다. 추후 데이터 큐레이션 코드, 학습 설정, 모델 체크포인트를 포함한 완전한 블루프린트를 공개함으로써, 누구나 SigLIP2급 비전 인코더를 재현하고 그 위에 쌓아올릴 수 있게 할 것입니다.

아직 남은 과제도 있습니다. 현재 영어 전용 데이터로 학습했는데, 다국어 데이터를 추가하면 영어 태스크의 성능까지 향상된다는 연구 결과들이 있습니다[20]. 또한 학습 중 모델 자체가 데이터 선별을 가이드하는 model-in-the-loop 큐레이션도 데이터 효율을 높일 수 있는 방향입니다.

Raon-VisionEncoder가 Raon의 훌륭한 눈이 되기를 기대해봅니다.

Citation

Jungseok Cho, Joo Young Choi†, Han EunGi, Hyunjin Kim†, Jaeah Lee‡, Hakyoung Lee, Seonho Lee, Suekyeong Nam, Soohwan Park†, Sungchan Park, Juhyeong Sun, Moonwon Yu

KRAFTON AI

† Project leads. ‡ Seoul National University. 저자는 알파벳순으로 나열되어 있습니다.

@misc{raon-visionencoder2026, title = {Raon-VisionEncoder: A Vision Encoder for Raon}, author = {Jungseok Cho and Joo Young Choi and Han EunGi and Hyunjin Kim and Jaeah Lee and Hakyoung Lee and Seonho Lee and Suekyeong Nam and Soohwan Park and Sungchan Park and Juhyeong Sun and Moonwon Yu}, year = {2026}, note = {KRAFTON AI} }

References