NVIDIA lança Nemotron 3.5 Lightning e NeMo Switchyard para IA mais eficiente
O Nemotron 3.5 Lightning foi desenvolvido para tarefas especializadas, enquanto o NeMo Switchyard direciona cada solicitação ao sistema mais adequado.
A NVIDIA amplia sua estratégia para agentes de inteligência artificial com duas frentes voltadas a desempenho e eficiência operacional. O Nemotron 3.5 Lightning chega como modelo especializado de 30 bilhões de parâmetros, enquanto o NeMo Switchyard organiza o encaminhamento de tarefas entre diferentes sistemas para equilibrar qualidade, velocidade e custo.
Nemotron 3.5 Lightning mira tarefas especializadas
A NVIDIA apresentou o Nemotron 3.5 Lightning como um modelo de 30 bilhões de parâmetros voltado a aplicações empresariais que exigem respostas rápidas e maior especialização.
A arquitetura baseada em mixture-of-experts permite ativar apenas partes relevantes do sistema em cada solicitação, estratégia que reduz o uso de recursos computacionais em tarefas complexas.
Entre os casos previstos aparecem revisão de código, análise de alertas de segurança e outras atividades que dependem de precisão elevada em ambientes com múltiplos agentes.
O modelo também pode receber ajustes com informações específicas de cada setor, o que facilita sua adaptação a fluxos internos de empresas com necessidades técnicas distintas.
Segundo dados apresentados pela NVIDIA, o Nemotron 3.5 Lightning pode alcançar velocidade até quatro vezes maior e reduzir em cerca de 30% o tempo necessário para concluir determinadas tarefas.
Essa proposta busca aproveitar melhor infraestruturas já instaladas, incluindo computadores com NVIDIA RTX, sistemas DGX e dispositivos Jetson utilizados em aplicações de borda.
A combinação entre desempenho, personalização e menor demanda computacional coloca o modelo como alternativa para organizações que pretendem ampliar o uso de inteligência artificial sem expandir imediatamente toda a infraestrutura.
NeMo Switchyard distribui tarefas entre modelos
O NeMo Switchyard funciona como uma biblioteca aberta criada pela NVIDIA para encaminhar cada solicitação ao modelo considerado mais adequado para aquele tipo de trabalho.
O sistema permite que desenvolvedores definam critérios relacionados a qualidade, custo e tempo de resposta antes de escolher qual modelo receberá determinada tarefa.
Essa abordagem ajuda empresas que utilizam diferentes modelos simultaneamente, porque reduz a necessidade de concentrar todas as solicitações em uma única opção mais cara ou mais lenta.
Também é possível combinar modelos da própria NVIDIA com alternativas abertas e proprietárias sem reconstruir toda a aplicação responsável pelo fluxo de agentes.
Em avaliações internas, a empresa afirma que o roteamento preservou níveis elevados de precisão e reduziu de forma relevante o custo total de conclusão das tarefas analisadas.
A biblioteca começa a aparecer em integrações com plataformas de empresas como Boomi, Cadence e Cognition, que procuram melhorar eficiência e controlar consumo de tokens.



