SÁBADO, 12 DE SEPTIEMBRE DE 2026
Claude Code 2.1.269 estrena claude plugin eval: seis graders y baseline sin plugin para gate en CI
Cada caso se corre con y sin plugin: el delta es la única métrica que prueba que aporta valor. Seis graders (regex, tool-use, LLM-judge, baseline y dos gratis más), `claude plugin eval init` entrevista el plugin y escribe la suite, y un report HTML deja fallar el merge en CI cuando el delta media cae al cambiar de modelo o versión.
4 MIN LECTURAOpenClaw 2026.9.1: Mermaid en chat, librerías personales de skills y blocklist SSRF
Los skills personales se importan desde ZIP y viven junto al workspace en Gateways compartidos sin mezclarse con los del equipo. La blocklist SSRF cierra rutas locales tras el rollback del update fallido.
Simon Willison actualiza openai-webrtc para GPT-Realtime-2 con contexto documental
Conversación de audio en el navegador contra GPT-Realtime-2 pasando un documento como contexto. Voice agent con datos privados sin backend ni STT/TTS y menos latencia que un pipeline en cascada.
OpenAI abre GPT-Live-1 en la API a 0,05 $/min: full-duplex voz para agentes
Un solo modelo escucha y habla en tiempo real, delega razonamiento en Codex o GPT-6-Astra y corta el pipeline STT→LLM→TTS en cascada. Menor latencia y una sola factura para agentes con voz.
Sakana Fugu Ultra v2: modelo orquestador multi-agente con endpoint compatible OpenAI
Router entrenado que reparte cada consulta entre modelos especializados y hasta se llama a sí mismo. Endpoint compatible OpenAI para enchufarlo sin tocar tu SDK, aunque sin pesos abiertos ni servicio directo en la UE.
Arquitectura de enjambres de 8 a 40 agentes en producción: scheduler, workers, críticos y reducers
El diseño no es 10.000 ChatGPTs en paralelo, sino jerarquía scheduler → workers → críticos → reducers con presupuesto por sub-goal: paraleliza solo cuando el trabajo independiente supera al coste de coordinar.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Correr claude plugin eval con baseline y gate en CI
# Entrevista tu plugin y escribe cases + graders automaticamente claude plugin eval init # Corre cada case con y sin plugin. La columna delta prueba # si el plugin aporta algo respecto al baseline claude plugin eval # Report HTML case a case (util para PR review) claude plugin eval --report ./eval-report.html # Gate en CI: falla el merge si la delta media cae por debajo # de 0.2 respecto al ultimo tag verde claude plugin eval --json \ | jq -e '([.cases[].delta] | add/length) >= 0.2'
- 01 Claude Code 2.1.269 añade /output-style intercambiable en headless y diff automático de ficheros tocados por Bash
- 02 MCP Inspector 2.6.0 llega a npm con TUI, CLI y web sobre un solo core
- 03 Anthropic publica Detecting and Countering Misuse: los ataques ya corren sobre frameworks de agente y roban la API key
- 04 Sakana lanza Fugu Max junto a Ultra v2 para orquestación multi-agente más barata
- 05 Simon Willison publica rich-text-to-markdown: paste de rich text a Markdown limpio sin backend
Cierre
El día empuja evidencia por encima de vibes. Anthropic convierte cada plugin y skill en algo medible: seis graders, baseline sin plugin y un delta que decide si el plugin de verdad hace su trabajo o si el modelo lo hacía ya sin él. Es la misma idea que Sakana aplica al modelo entero con Fugu Ultra v2, y que el post de arquitectura de enjambres sube a nivel sistema: si no mides el aporte real de cada capa, estás pagando tokens que no aportan al output. Alrededor, OpenClaw endurece SSRF y separa los skills personales de los del equipo, y OpenAI cierra el pipeline de voz con GPT-Live-1. Ya no puedes salir de la reunión de arquitectura diciendo “el agente parece mejor con el plugin nuevo”: o lo pruebas con evaluaciones que fallan el merge, o no está en producción.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.