
GLM-4.6V는 GLM의 최신 오픈소스 멀티모달 모델 시리즈로, 시각적 인식과 실행 가능한 작업을 연결하도록 설계되었습니다. 클라우드 및 고성능 클러스터용 GLM-4.6V(106B 파라미터)와 로컬 배포 및 저지연 애플리케이션용 GLM-4.6V-Flash(9B 파라미터)의 두 가지 버전으로 제공됩니다. 128k 토큰 컨텍스트 윈도우를 통해 단일 처리로 약 150페이지 분량의 문서, 200장의 슬라이드 또는 1시간 분량의 비디오를 처리할 수 있습니다. 가장 주목할 만한 혁신은 **네이티브 함수 호출(Function Calling)**로, 중간 텍스트 변환 없이 시각적 입력에서 직접 도구를 사용할 수 있게 합니다.
GLM-4.6V는 도구 호출을 시각적 파이프라인에 직접 통합하여 별도의 텍스트 기반 변환을 제거합니다. 이를 통해 모델이 이미지를 인식하고, 검색 API를 호출하며, 추론된 답변을 반환하는 모든 과정을 하나의 종단 간 흐름으로 처리할 수 있습니다. 이 기능은 대규모 합성 에이전트 데이터를 사용하여 훈련되었으며, 모델 컨텍스트 프로토콜(MCP)을 통해 확장됩니다.
이 모델은 훈련 컨텍스트를 128k 토큰으로 확장하여 정보 밀도가 높은 입력에서 효과적인 교차 모달 의존성 모델링을 가능하게 합니다. 대규모 장기 컨텍스트 이미지-텍스트 데이터에 대한 체계적인 지속 사전 훈련을 통해 수백 페이지 또는 긴 비디오에서도 일관성을 유지합니다.
사전 훈련 중 GLM-4.6V는 백과사전적 지식을 포괄하는 수십억 규모의 멀티모달 데이터셋을 사용합니다. 이 다층적 개념 시스템은 기본적인 시각적 인식을 개선하고, 특히 복잡하거나 전문적인 주제에 대한 교차 모달 질의응답 작업의 정확성을 높입니다.
UI2Code^N 접근 방식에서 영감을 받은 이 모델은 시각적 렌더링 결과를 사용하여 코드나 작업을 스스로 교정할 수 있습니다. 이 "시각적 피드백 루프"를 통해 GLM-4.6V는 출력을 반복적으로 개선할 수 있으며, 실제 비즈니스 시나리오에서 자기 개선형 멀티모달 에이전트의 가능성을 보여줍니다.
"GLM-4.6V는 인식에서 이해, 실행으로 이어지는 루프를 완성하여, 풍부한 텍스트 콘텐츠 생성 및 시각적 웹 검색과 같은 복잡한 작업을 단일 종단 간 처리로 가능하게 합니다."
시각적 입력과 함수 호출의 이러한 네이티브 통합은 오픈소스 멀티모달 모델 중 최초입니다. 기존의 도구 사용은 이미지나 비디오를 처리할 때 여러 번의 텍스트 기반 변환이 필요하여 정보 손실 위험이 있습니다. GLM-4.6V는 이를 완전히 우회하여, 모델이 슬라이드를 인식하고, 관련 데이터를 온라인에서 검색하며, 구조화된 보고서를 생성하는 모든 과정을 중간 단계 없이 수행할 수 있습니다. 그 결과 복잡한 도구 체인에서 계획, 실행 및 자기 교정이 가능한 멀티모달 에이전트를 위한 통합된 기술 기반을 제공합니다.
시각적 검색, 문서 분석 또는 프론트엔드 코드 생성을 위해 인식, 추론 및 실행을 단일 워크플로우에서 수행할 수 있는 오픈소스 멀티모달 모델이 필요하다면 주목할 만합니다. 128k 컨텍스트 윈도우와 네이티브 도구 호출은 긴 비디오 처리나 복잡한 보고서 분석과 같은 정보 밀도가 높은 작업에 특히 유용합니다. MCP 통합을 갖춘 에이전트 시스템을 탐구하는 개발자라면 내장된 함수 호출과 시각적 피드백 루프가 자기 개선형 에이전트 구축을 위한 실용적인 기반이 될 것입니다.
고려해볼 만한 다른 도구
Loading comments…
제작자
async_apple
웹사이트 방문
z.ai/blog/glm-4.6v
프로젝트 정보
제품 키워드
비교
성과