Qwen2.5-VL, 시각-언어 모델의 새로운 플래그십 공개
Qwen2.5-VL은 Qwen의 새로운 플래그십 시각-언어 모델로, 시각적 이해, 에이전트 기능, 장시간 비디오 분석, 정밀한 객체 위치 파악 및 구조화된 출력 생성을 강화했다. 3B, 7B, 72B 모델로 제공되며, 시공간 스케일 인식과 효율적인 시각 인코더를 통해 성능을 크게 향상했다.
알리바바 클라우드의 Qwen 팀은 새로운 플래그십 시각-언어 모델인 Qwen2.5-VL을 공개했다. 이 모델은 이전 버전인 Qwen2-VL에서 크게 발전하여 시각적 이해 능력, 에이전트 기능, 장시간 비디오 분석, 정밀한 객체 위치 파악 및 구조화된 출력 생성 기능을 강화했다. Qwen2.5-VL은 3B, 7B, 72B의 세 가지 크기로 기반 모델과 지시 모델이 제공되며, Qwen Chat, Hugging Face, ModelScope를 통해 접근할 수 있다.
Qwen2.5-VL의 개발은 멀티모달 대규모 모델에서 시각 인코더의 중요성을 인식하고, 시공간 스케일 인식 능력을 강화하며 모델 효율성을 개선하려는 배경에서 이루어졌다. 특히, 다양한 디지털화 및 지능화 요구에 맞춰 문서 이해, 정보 추출, 비디오 분석 등 복잡한 시각적 작업을 처리할 수 있도록 모델의 핵심 역량을 향상하는 데 중점을 두었다. 이는 기존 Qwen2-VL 대비 모델의 지각 능력을 확장하고 네트워크 구조를 간소화하여 전반적인 성능 향상을 목표로 한다.
Qwen2.5-VL은 시공간 스케일 인식 능력을 크게 개선했다. 공간 차원에서는 다양한 크기의 이미지를 가변 길이 토큰으로 동적으로 변환하며, 감지 상자나 점과 같은 좌표를 전통적인 정규화 없이 실제 이미지 크기 스케일로 직접 표현한다. 이를 통해 모델은 이미지의 실제 스케일을 직접 학습할 수 있다. 시간 차원에서는 동적 FPS(Frames Per Second) 훈련과 절대 시간 인코딩 기술을 도입했다. mRoPE ID를 시간 속도에 직접 정렬함으로써 모델은 시간 차원 ID 간격을 통해 시간의 흐름을 학습하며, 이는 장시간 비디오 이해 및 초 단위 이벤트 위치 파악 능력으로 이어진다.
모델의 시각 인코더는 더욱 간결하고 효율적으로 설계되었다. Qwen2.5-VL은 CLIP, 비전-언어 모델 정렬, 엔드투엔드 훈련 단계를 포함하는 네이티브 동적 해상도 ViT(Vision Transformer)를 처음부터 훈련했다. 멀티모달 대규모 모델의 훈련 및 테스트 단계에서 ViT의 로드 불균형 문제를 해결하기 위해 Window Attention을 도입했다. ViT 설정에서 4개 레이어만 Full Attention을 사용하고 나머지는 Window Attention을 활용하며, 최대 윈도우 크기는 8x8이다. 8x8보다 작은 영역은 패딩 없이 원본 스케일을 유지하여 네이티브 해상도를 보존한다. 또한, 전체 네트워크 구조를 간소화하기 위해 ViT 아키텍처에 RMSNorm 및 SwiGLU 구조를 채택하여 LLM(Large Language Model)과의 일관성을 높였다.
성능 면에서 Qwen2.5-VL-72B-Instruct는 대학 수준 문제, 수학, 문서 이해, 일반 질문 응답, 비디오 이해, 시각 에이전트 등 다양한 벤치마크에서 경쟁력 있는 성능을 보인다. 특히 문서 및 다이어그램 이해와 작업별 미세 조정 없이 시각 에이전트 역할을 수행하는 능력에서 상당한 강점을 나타낸다. 소형 모델 중 Qwen2.5-VL-7B-Instruct는 여러 작업에서 GPT-4o-mini를 능가하며, 엣지 AI 솔루션인 Qwen2.5-VL-3B는 이전 버전 Qwen2-VL의 7B 모델보다 우수한 성능을 제공한다. 또한, Qwen2.5-VL은 QwenVL HTML이라는 고유한 문서 구문 분석 형식을 도입하여 HTML 기반으로 레이아웃 정보를 추출한다. 이 형식은 잡지, 연구 논문, 웹 페이지, 모바일 스크린샷 등 다양한 시나리오에서 문서 구문 분석을 수행할 수 있다.
Qwen2.5-VL의 출시는 개발자와 사용자에게 여러 긍정적인 영향을 미친다. 개발자는 Hugging Face 및 ModelScope에서 제공되는 다양한 크기의 모델을 활용하여 시각-언어 기반 애플리케이션을 구축할 수 있다. 특히, 작업별 미세 조정 없이도 시각 에이전트 기능을 활용할 수 있어 개발 편의성이 증대된다. 사용자는 금융 및 상업 분야에서 송장, 양식, 테이블 스캔과 같은 데이터의 내용을 구조화된 출력으로 받아볼 수 있어 정보 처리 효율성을 높일 수 있다. 또한, 장시간 비디오에서 특정 이벤트를 초 단위로 검색하고 핵심 내용을 요약하는 기능은 방대한 비디오 데이터에서 필요한 정보를 신속하게 추출하는 데 도움을 준다. OCR 및 정보 추출 능력의 향상은 자격 심사, 금융 업무 등 디지털화된 비즈니스 환경에서 요구되는 정밀한 정보 처리 수요를 충족한다.
Qwen2.5-VL은 현재 시각-언어 모델로서 다양한 시각적 이해 및 처리 작업을 지원한다. 모델은 Qwen Chat을 통해 직접 체험할 수 있으며, Hugging Face와 ModelScope에서 공개된 모델을 다운로드하여 활용할 수 있다. 원문에서는 모델의 명시적인 제약 사항을 직접적으로 언급하지는 않지만, 향후 계획을 통해 현재의 한계와 미래 발전 방향을 제시한다. Qwen 팀은 가까운 미래에 모델의 문제 해결 및 추론 능력을 더욱 강화하고, 더 많은 양식(모달리티)을 통합하여 다양한 유형의 입력과 작업을 처리할 수 있는 통합된 옴니 모델로 발전시킬 계획이라고 밝힌다. 이는 현재 모델이 특정 양식에 중점을 두고 있음을 시사하며, 지속적인 개선을 통해 범용성을 확대할 것임을 나타낸다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen2.5 VL! Qwen2.5 VL! Qwen2.5 VL!
원문 발행: 2025-01-26 20:08:30
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.