Qwen2.5-VL-32B, 강화 학습으로 성능과 효율성 개선
Qwen2.5-VL-32B-Instruct 모델이 Apache 2.0 라이선스로 공개되었다. 이 모델은 강화 학습을 통해 인간 선호도에 부합하는 응답, 수학적 추론, 세밀한 이미지 이해 능력을 향상시켰으며, 동급 및 일부 대규모 모델 대비 우수한 성능을 보인다.
알리바바 클라우드는 Qwen2.5-VL 시리즈 모델의 최적화 버전인 Qwen2.5-VL-32B-Instruct를 Apache 2.0 라이선스로 오픈소스화했다. 이 새로운 모델은 기존 Qwen2.5-VL 시리즈를 기반으로 강화 학습을 통해 성능을 개선했으며, 32B 파라미터 규모에서 인간 선호도에 더 부합하는 상세하고 형식화된 응답을 제공한다. 또한, 복잡한 수학 문제 해결의 정확도를 크게 높였으며, 이미지 분석, 콘텐츠 인식, 시각적 논리 추론과 같은 세밀한 이미지 이해 및 추론 작업에서 향상된 정확도와 상세 분석 능력을 보인다.
올해 1월 말 Qwen2.5-VL 시리즈 모델이 출시된 이후 커뮤니티로부터 광범위한 관심과 긍정적인 피드백을 받았다. 이러한 성공을 바탕으로 알리바바 클라우드는 모델 최적화를 지속했으며, 특히 "빠른 사고(fast thinking)" 패러다임 내에서 주관적인 사용자 경험과 수학적 추론 능력을 강화하는 데 중점을 두었다. 이는 멀티모달 모델이 실제 사용 환경에서 더욱 유용하고 정확한 정보를 제공할 수 있도록 하기 위한 노력의 일환이다.
Qwen2.5-VL-32B-Instruct는 광범위한 벤치마크 테스트에서 동급 최첨단(SoTA) 모델 대비 우수한 성능을 입증했다. 예를 들어, Mistral-Small-3.1-24B 및 Gemma-3-27B-IT와 같은 모델을 능가하며, 심지어 더 큰 규모의 Qwen2-VL-72B-Instruct 모델보다도 뛰어난 결과를 보였다. 특히, 복잡하고 다단계 추론을 요구하는 MMMU, MMMU-Pro, MathVista와 같은 멀티모달 벤치마크에서 상당한 우위를 점한다. 주관적인 사용자 경험 평가에 중점을 둔 MM-MT-Bench에서도 이전 모델인 Qwen2-VL-72B-Instruct를 큰 폭으로 앞섰다. 시각적 능력 외에도 순수 텍스트 처리 능력에서도 동급 모델 중 최고 수준의 성능을 달성한다.
모델의 세밀한 이미지 이해 및 추론 능력은 다양한 데모 사례를 통해 시연되었다. 예를 들어, 트럭 운전자가 12시에 출발하여 시속 100km의 속도 제한이 있는 도로에서 110km 떨어진 목적지에 13시 이전에 도착할 수 있는지 묻는 질문에, 모델은 필요한 이동 시간을 1.1시간(1시간 6분)으로 정확히 계산하여 13시 6분에 도착하므로 13시 이전에 도착할 수 없다고 추론한다. 또한, 기하학 문제에서 교차하는 직선과 각도 이등분선 정보를 바탕으로 미지의 각도를 단계별로 계산하거나, 정육면체 면적의 등비수열 일반항을 도출하는 등 복잡한 수학적 추론 문제들을 상세한 풀이 과정과 함께 정확하게 해결한다.
타원 방정식과 기하학적 관계를 이용한 문제에서는, 주어진 타원의 꼭짓점과 이심률 정보를 통해 타원 방정식을 확정하고, 특정 직선과 타원의 교점, x축 교점 P, 그리고 두 직선의 교점 Q의 x좌표 사이의 관계($x_P \cdot x_Q = 4$)를 복잡한 대수적 과정을 거쳐 증명한다. 세밀한 이미지 이해 측면에서는, 사천 마라 훠궈 이미지를 분석하여 붉은색 국물, 고추와 화자오, 분할된 냄비 디자인, 주변 재료 등을 근거로 사천 훠궈의 특징을 상세히 설명한다. 이는 모델이 시각적 단서를 정확히 파악하고 문화적 배경 지식과 결합하여 추론하는 능력을 보여준다.
Qwen2.5-VL-32B-Instruct의 오픈소스화는 개발자들에게 강력한 멀티모달 AI 모델을 활용할 기회를 제공한다. Apache 2.0 라이선스 덕분에 상업적 및 연구 목적으로 자유롭게 모델을 통합하고 수정할 수 있다. 특히, 인간의 선호도에 더 가까운 응답 스타일과 향상된 수학적 추론 및 세밀한 이미지 이해 능력은 교육, 콘텐츠 생성, 시각적 검색, 복잡한 데이터 분석 등 다양한 분야의 애플리케이션 개발에 기여할 수 있다. 동급 모델 대비 뛰어난 성능과 효율성은 개발 비용 절감 및 성능 향상에 긍정적인 영향을 미칠 것으로 예상된다.
현재 Qwen2.5-VL-32B-Instruct는 주로 "빠른 사고" 패러다임 내에서 주관적 경험과 수학적 추론 최적화에 초점을 맞추고 있다. 이는 모델이 즉각적이고 명확한 추론이 필요한 작업에서 강점을 보인다는 의미이다. 그러나 알리바바 클라우드는 향후 연구 방향으로 시각 모델이 고도로 복잡하고 다단계 시각 추론 작업을 해결하기 위한 길고 효과적인 추론 프로세스를 우선시할 계획이라고 밝혔다. 이는 현재 모델이 매우 복잡하고 심층적인 다단계 시각 추론에서는 아직 개선의 여지가 있음을 시사하며, 미래 업데이트를 통해 이러한 한계가 극복될 수 있음을 나타낸다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen2.5-VL-32B: Smarter and Lighter
원문 발행: 2025-03-24 01:00:04
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.