JUEVES, 20 DE AGOSTO DE 2026
Claude Code v2.1.237 restaura la caché de prompts en LLM gateways y estrena estilo de salida Concise
Sesiones enrutadas por LiteLLM, OpenRouter, Cloudflare AI Gateway o Bedrock recuperan hoy el hit-rate de caché que colgaba desde 2.1.229: si tu factura subió 2-3x con el mismo tráfico, actualiza. Encima, el nuevo estilo Concise deja a Claude arrancar por el resultado sin preámbulo: menos tokens de salida por respuesta en cada turno de agente.
4 MIN LECTURAAnthropic pasa Files API y Agent Skills a GA: sin header beta y con endpoint /v1/skills
Adjuntas una Skill (pptx, xlsx, docx, pdf o custom) a Messages API vía `container.skill_id` y gestionas versiones por HTTP: se acabaron los `anthropic-beta: files-api-2025-04-14` y `skills-2025-*` colgados en producción. Admin API user management también entra en GA.
Cursor 08-19: cloud agents que se suscriben a eventos, /goal persistente y steering sin interrumpir
Un cloud agent se suscribe a una PR, un hilo de Slack o un cron y despierta cuando pasa algo; `/goal` mantiene un objetivo durable entre runs headless. Enter mientras el agente trabaja mete tu mensaje en el próximo tool call sin cortar la ejecución. Subagentes ahora corren en su propia VM aislada.
Claude Code v2.1.236 añade ANTHROPIC_DEFAULT_MODEL y notify_when_idle cross-session
`ANTHROPIC_DEFAULT_MODEL` fija el modelo con el que arranca cada sesión pero deja que `/model` persista tu pick — pon Fable 5 por defecto sin bloquear picks manuales. `notify_when_idle` en SendMessage pide un aviso puntual cuando otra sesión local queda idle, sin polling.
NVIDIA Nemotron 3.5 Lightning llega a Ollama: MoE de 30B con 3B activos y 1M de contexto
Modelo pensado para agentes always-on locales: 4x throughput y 30% menos tiempo por tarea que abiertos comparables, con builds MLX en Apple Silicon y NVFP4 en NVIDIA. `ollama launch claude --model nemotron-3.5-lightning` te sustituye el modelo remoto sin tocar la CLI.
Simon Willison mide Qwen3.8-27B: 22 276 tokens de razonamiento por defecto para dibujar un pelícano
En LM Studio con `reasoning_effort=xhigh` (el default), Qwen3.8-27B quema 21 minutos por prompt. Bajar a `medium` recorta 10x el gasto sin degradar tareas de código: la lección práctica es tocar el effort por request en tu router de modelos antes de meter Qwen en un agente.
Prime Agent (PrimeIntellect) suma +2 293 estrellas en un día: RLM harness MIT donde los subagentes son función Python
El agente corre en un kernel IPython persistente y llama subagentes como `rlm(...)` desde código; `/refine` convierte trayectorias pasadas en skills reusables en la sesión. Con Opus 5 reporta 95,5% en ARC-AGI-3 y desengancha el harness del modelo — te lo llevas a Qwen o DeepSeek sin reescribir orquestación.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Output style custom para Claude Code: Concise + reglas de tu equipo
# Guarda esto en ~/.claude/output-styles/prod-concise.md # y actívalo con: /output-style prod-concise # (o "outputStyle": "prod-concise" en settings.json). # El front-matter va literalmente asi, con tres guiones. --- name: prod-concise description: Concise + reglas de mi equipo para trabajo en produccion --- Arranca por el resultado. Nunca por "voy a...", "primero...", "he hecho X". No repitas lo que ya sale en un tool result: si un diff, un log o una URL responden por ti, referencialos y calla. NO escribas planes ni TODOs a menos que te los pidan. NO propongas refactors, dependencias nuevas ni cambios fuera del scope de la peticion. Si detectas un bug adyacente, apuntalo en una linea al final: "Nota: <archivo>:<linea> tiene <problema>." Nada mas. Codigo: aplica las reglas del repo (CLAUDE.md o AGENTS.md) antes que las tuyas. Sin comentarios que expliquen que hace el codigo; solo el "por que" cuando no sea obvio. Prefiere ediciones pequenas a reescribir bloques enteros. Cierre del turno: una frase con lo que cambio y una con el siguiente paso concreto si aplica. Nada de resumenes largos ni checklists.
- 01 Anthropic Admin API user management pasa a GA para organizaciones Claude Enterprise
- 02 Cursor: subagentes cloud corren en su propia VM con contexto limpio y transcript ordenado
- 03 Claude Code auto-mode: reglas de allow del tool Monitor ahora pasan por el clasificador
- 04 Ollama libera build NVFP4 de Nemotron 3.5 Lightning para inferencia FP4 en NVIDIA
- 05 Anthropic Managed Agents suma controles de web access y self-hosted sandbox memory stores
Cierre
La señal del día es un stack agéntico que empieza a comportarse como una plataforma seria. Anthropic cierra el círculo de la API: Files y Agent Skills ya son estables, con endpoints REST para versionarlas, y Admin API deja gestionar miembros y roles por HTTP en Claude Enterprise. Cursor convierte los cloud agents en workers que se suscriben a PRs y a Slack y aguantan un /goal entre runs, mientras Claude Code cierra el paréntesis de dos semanas de caché rota en LLM Gateway y añade un estilo Concise que recorta tokens de salida por turno. En paralelo, NVIDIA Nemotron 3.5 Lightning aterriza en Ollama con 3B activos y 1M de contexto para agentes locales, y Prime Agent confirma que la próxima diferencia competitiva no es qué modelo llamas, sino qué harness lo llama por ti.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.