NVIDIA lança Nemotron 3.5 Lightning e NeMo Switchyard para IA mais eficiente

O Nemotron 3.5 Lightning foi desenvolvido para tarefas especializadas, enquanto o NeMo Switchyard direciona cada solicitação ao sistema mais adequado.

A NVIDIA amplia sua estratégia para agentes de inteligência artificial com duas frentes voltadas a desempenho e eficiência operacional. O Nemotron 3.5 Lightning chega como modelo especializado de 30 bilhões de parâmetros, enquanto o NeMo Switchyard organiza o encaminhamento de tarefas entre diferentes sistemas para equilibrar qualidade, velocidade e custo.

Nemotron 3.5 Lightning mira tarefas especializadas

A NVIDIA apresentou o Nemotron 3.5 Lightning como um modelo de 30 bilhões de parâmetros voltado a aplicações empresariais que exigem respostas rápidas e maior especialização.

A arquitetura baseada em mixture-of-experts permite ativar apenas partes relevantes do sistema em cada solicitação, estratégia que reduz o uso de recursos computacionais em tarefas complexas.

Entre os casos previstos aparecem revisão de código, análise de alertas de segurança e outras atividades que dependem de precisão elevada em ambientes com múltiplos agentes.

O modelo também pode receber ajustes com informações específicas de cada setor, o que facilita sua adaptação a fluxos internos de empresas com necessidades técnicas distintas.

Segundo dados apresentados pela NVIDIA, o Nemotron 3.5 Lightning pode alcançar velocidade até quatro vezes maior e reduzir em cerca de 30% o tempo necessário para concluir determinadas tarefas.

Essa proposta busca aproveitar melhor infraestruturas já instaladas, incluindo computadores com NVIDIA RTX, sistemas DGX e dispositivos Jetson utilizados em aplicações de borda.

A combinação entre desempenho, personalização e menor demanda computacional coloca o modelo como alternativa para organizações que pretendem ampliar o uso de inteligência artificial sem expandir imediatamente toda a infraestrutura.

NeMo Switchyard distribui tarefas entre modelos

O NeMo Switchyard funciona como uma biblioteca aberta criada pela NVIDIA para encaminhar cada solicitação ao modelo considerado mais adequado para aquele tipo de trabalho.

O sistema permite que desenvolvedores definam critérios relacionados a qualidade, custo e tempo de resposta antes de escolher qual modelo receberá determinada tarefa.

Essa abordagem ajuda empresas que utilizam diferentes modelos simultaneamente, porque reduz a necessidade de concentrar todas as solicitações em uma única opção mais cara ou mais lenta.

Também é possível combinar modelos da própria NVIDIA com alternativas abertas e proprietárias sem reconstruir toda a aplicação responsável pelo fluxo de agentes.

Em avaliações internas, a empresa afirma que o roteamento preservou níveis elevados de precisão e reduziu de forma relevante o custo total de conclusão das tarefas analisadas.

A biblioteca começa a aparecer em integrações com plataformas de empresas como Boomi, Cadence e Cognition, que procuram melhorar eficiência e controlar consumo de tokens.

Exit mobile version