JUEVES, 13 DE AGOSTO DE 2026
NVIDIA libera Nemotron 3.5 Lightning y abre NeMo Switchyard para enrutar agentes entre modelos
Publica en Hugging Face Nemotron 3.5 Lightning: MoE 30B con 3B activos por token, arquitectura Mamba-2 + Attention y contexto de 1M. 4× más rápido que un denso equivalente en tareas agentic. Junto al modelo abre NeMo Switchyard, router de código abierto para elegir el modelo más barato en cada llamada sin tocar tu código.
5 MIN LECTURANVIDIA-NeMo/Switchyard aterriza en GitHub con enrutamiento dinámico entre Claude, Ollama y Nemotron
Router de código abierto compatible con endpoint OpenAI y Anthropic: apuntas tu `ANTHROPIC_BASE_URL` al proxy y Switchyard elige el modelo más barato por intent, contexto o presupuesto. Sustituye la lógica de fallback que hoy escribes a mano en cada agente.
Modular publica Mojo 1.0 con API estable y garantías de retrocompatibilidad
Sale de tres años de churn: API congelada, retrocompatibilidad garantizada y el lote 26.5 añade closures lambda, diagnósticos de memoria y punteros tipados. Puedes empezar a escribir kernels de inferencia sin miedo a romperlos con la siguiente 1.x.
Claude Code v2.1.229 estrena hooks servidos por el runner autoalojado y keepalives SSE
Los runners autoalojados ahora inyectan hooks propios del servidor y las respuestas streaming reciben pings de keepalive para no morir por idle-timeout en corporativos. Tapa además el bug del atributo de auto mode y crashes con `glob`/`file_path` no-string.
Cactus libera Needle2, agente de 45M parámetros que corre en 28MB de RAM sobre ESP32-S3
LLM agentic Apache 2.0 empaquetado en 14MB con cuantización CQ2 nativa: 500 tok/s en Raspberry Pi 5 y compite con modelos 5-70× mayores en Mobile Actions y BFCL v4. Meritocracia real para pushear inferencia agentic al edge sin API externa.
Cómo enrutar trabajos de agentes entre modelos con NVIDIA NeMo Switchyard
Tutorial oficial paso a paso: `routes.toml` con reglas por intent, presupuesto y longitud de contexto, arranque del servidor Rust y ejemplos con Claude Code y Codex. Reemplaza tu router de bolsillo por algo con métricas de latencia y coste ya integradas.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Enrutar Claude Code a NeMo Switchyard sin tocar tu código
# routes.toml — envia cada llamada al modelo mas barato que la resuelve # Comportamiento: reasoning duro va a Opus 5, tool calls y extraccion # a Nemotron Lightning (30B/3B activos, 4x mas rapido), y si el # presupuesto llega a 0 cae a un modelo local en Ollama. [[route]] name = "reasoning-hard" match = { intent = "planning", context_tokens_min = 20000 } model = "anthropic/claude-opus-5" [[route]] name = "tool-calls-fast" match = { intent = "tool-use | extraction | classification" } model = "nvidia/nemotron-3.5-lightning-30b-a3b" [[route]] name = "fallback-local" match = { budget_cents_max = 0 } model = "ollama/qwen3.6:14b" # Levanta el proxy compatible con OpenAI y Anthropic en 127.0.0.1:4000 # y redirige tus clientes sin tocar una linea de codigo del agente: # export ANTHROPIC_BASE_URL=http://127.0.0.1:4000/anthropic # export OPENAI_BASE_URL=http://127.0.0.1:4000/openai switchyard-server --config routes.toml --host 127.0.0.1 --port 4000
- 01 Unsloth publica Nemotron 3.5 Lightning en GGUF listo para llama.cpp
- 02 Nemotron 3.5 Lightning arranca como microservicio NIM en build.nvidia.com
- 03 Alibaba retrasa los pesos abiertos de Qwen3.8-Max pese al plazo del 10-16 de agosto
- 04 Modular abre el hilo oficial de release para Mojo 1.0 en su foro
- 05 VentureBeat: Switchyard baja el coste por tarea al 33% enrutando modelos a mitad de flujo
Cierre
Hoy la señal es que la capa de infraestructura de agentes se estandariza en abierto. NVIDIA libera Nemotron 3.5 Lightning —30B con 3B activos, 4× más rápido que un denso equivalente— y abre NeMo Switchyard para enrutar cada llamada al modelo que la resuelve más barato sin reescribir tu app. Modular cierra tres años de churn con Mojo 1.0 estable y Cactus demuestra con Needle2 que un agente cabe en 14MB para el ESP32. La suma vale más que las partes: hoy puedes montar un conjunto agentic donde Claude Opus 5, Nemotron y Ollama conviven detrás del mismo endpoint compatible con OpenAI, y solo pagas nube cuando el problema lo justifica.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.