IA multimodal ganha força com o GLM-4.6V da Z.ai

O GLM-4.6V é um modelo open-source multimodal que integra ferramentas para processar entradas e saídas visuais, facilitando a criação de conteúdo e a busca visual, e oferecendo uma base técnica unificada para aplicações em negócios.

A Z.ai apresentou os novos modelos multimodais GLM-4.6V, projetados para elevar o padrão de compreensão visual e raciocínio em aplicações corporativas. As versões GLM-4.6V (106B), voltada para uso em nuvem, e GLM-4.6V-Flash (9B), indicada para implantação local, ampliam a capacidade das empresas de operar agentes inteligentes em diferentes ambientes tecnológicos.

Uso nativo de ferramentas multimodais

O GLM-4.6V da Z.ai revoluciona a integração de ferramentas multimodais ao permitir o uso nativo dessas capacidades.

Tradicionalmente, modelos de linguagem de larga escala (LLMs) enfrentam limitações ao lidar com dados multimodais, como imagens e vídeos, pois exigem conversões intermediárias para texto, o que pode resultar em perda de informações e aumentar a complexidade do sistema.

Com o GLM-4.6V, isso muda significativamente. O modelo é capaz de aceitar entradas multimodais diretamente como parâmetros de ferramentas, sem a necessidade de convertê-las em descrições textuais antecipadamente.

Isso não só evita a perda de informações, como também simplifica consideravelmente o fluxo de trabalho.

Além disso, o GLM-4.6V pode interpretar saídas multimodais, como resultados de buscas, gráficos estatísticos, capturas de tela renderizadas ou imagens de produtos recuperadas, integrando essas informações na cadeia de raciocínio subsequente e no resultado final.

Essa capacidade permite que o modelo feche o ciclo de percepção, compreensão e execução, habilitando a realização de tarefas complexas, como a criação de conteúdo rico em texto e a busca visual na web.

Exit mobile version