Saltar al contenido
5 minutos de IA

SÁBADO, 12 DE SEPTIEMBRE DE 2026

NOTICIA DESTACADA

Claude Code 2.1.269 estrena claude plugin eval: seis graders y baseline sin plugin para gate en CI

Cada caso se corre con y sin plugin: el delta es la única métrica que prueba que aporta valor. Seis graders (regex, tool-use, LLM-judge, baseline y dos gratis más), `claude plugin eval init` entrevista el plugin y escribe la suite, y un report HTML deja fallar el merge en CI cuando el delta media cae al cambiar de modelo o versión.

4 MIN LECTURA
NOTICIAS DEL DÍA
OPEN SOURCE

OpenClaw 2026.9.1: Mermaid en chat, librerías personales de skills y blocklist SSRF

Los skills personales se importan desde ZIP y viven junto al workspace en Gateways compartidos sin mezclarse con los del equipo. La blocklist SSRF cierra rutas locales tras el rollback del update fallido.

OpenClaw Releases · 3 MIN LEER FUENTE →
INDIE / COMUNIDAD

Simon Willison actualiza openai-webrtc para GPT-Realtime-2 con contexto documental

Conversación de audio en el navegador contra GPT-Realtime-2 pasando un documento como contexto. Voice agent con datos privados sin backend ni STT/TTS y menos latencia que un pipeline en cascada.

tools.simonwillison.net · 3 MIN LEER FUENTE →
INDUSTRIA

OpenAI abre GPT-Live-1 en la API a 0,05 $/min: full-duplex voz para agentes

Un solo modelo escucha y habla en tiempo real, delega razonamiento en Codex o GPT-6-Astra y corta el pipeline STT→LLM→TTS en cascada. Menor latencia y una sola factura para agentes con voz.

OpenAI · 3 MIN LEER FUENTE →
HERRAMIENTAS

Sakana Fugu Ultra v2: modelo orquestador multi-agente con endpoint compatible OpenAI

Router entrenado que reparte cada consulta entre modelos especializados y hasta se llama a sí mismo. Endpoint compatible OpenAI para enchufarlo sin tocar tu SDK, aunque sin pesos abiertos ni servicio directo en la UE.

Sakana AI · 4 MIN LEER FUENTE →
TÉCNICAS

Arquitectura de enjambres de 8 a 40 agentes en producción: scheduler, workers, críticos y reducers

El diseño no es 10.000 ChatGPTs en paralelo, sino jerarquía scheduler → workers → críticos → reducers con presupuesto por sub-goal: paraleliza solo cuando el trabajo independiente supera al coste de coordinar.

DEV Community · 6 MIN LEER FUENTE →
SNIPPET DEL DÍA

Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.

Correr claude plugin eval con baseline y gate en CI

# Entrevista tu plugin y escribe cases + graders automaticamente claude plugin eval init # Corre cada case con y sin plugin. La columna delta prueba # si el plugin aporta algo respecto al baseline claude plugin eval # Report HTML case a case (util para PR review) claude plugin eval --report ./eval-report.html # Gate en CI: falla el merge si la delta media cae por debajo # de 0.2 respecto al ultimo tag verde claude plugin eval --json \ | jq -e '([.cases[].delta] | add/length) >= 0.2'

CLAUDE CODE DOCS VER FUENTE →

Cierre

El día empuja evidencia por encima de vibes. Anthropic convierte cada plugin y skill en algo medible: seis graders, baseline sin plugin y un delta que decide si el plugin de verdad hace su trabajo o si el modelo lo hacía ya sin él. Es la misma idea que Sakana aplica al modelo entero con Fugu Ultra v2, y que el post de arquitectura de enjambres sube a nivel sistema: si no mides el aporte real de cada capa, estás pagando tokens que no aportan al output. Alrededor, OpenClaw endurece SSRF y separa los skills personales de los del equipo, y OpenAI cierra el pipeline de voz con GPT-Live-1. Ya no puedes salir de la reunión de arquitectura diciendo “el agente parece mejor con el plugin nuevo”: o lo pruebas con evaluaciones que fallan el merge, o no está en producción.

¿LLEVAS IA A PRODUCCIÓN EN TU EMPRESA?

Iván consulta sobre todo esto

Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.