DOMINGO, 13 DE SEPTIEMBRE DE 2026
claude plugin eval llega en 2.1.269 y te mide si tu plugin sube o baja al modelo
Ejecuta un conjunto de casos con graders (regex, tool_called, rúbrica juzgada por otro modelo) primero con el plugin cargado y luego sin él. El delta te dice si aporta valor o solo ruido, con informe JSON+HTML reproducible en integración continua.
5 MIN LECTURADeepSeek libera V4.1 Flash bajo MIT: 552B MoE, 8B activos, 1M de contexto
Multimodal nativo con pesos abiertos en Hugging Face: lo alojas tú mismo con 8B activos por token o lo consumes por API a menor precio que V4 sin atarte al proveedor.
Ontheia: plataforma de agentes MCP-nativa, self-hosted y AGPLv3
PostgreSQL con pgvector, Row Level Security por usuario, memoria episódica/semántica y motor visual de cadenas: te llevas un ChatGPT/Claude corporativo sin sacar datos de tu VPC.
context-mode: 98% menos tokens del tool output en tu agente de código
Aísla la salida de herramientas fuera del contexto y la indexa para consulta bajo demanda, con memoria de sesión persistente para 17 plataformas (Claude Code, Cursor, Codex, Gemini CLI).
agent-browser: CLI en Rust para automatizar navegador desde agentes
Snapshots con referencias semánticas (@e1, @e2), servidor MCP integrado y persistencia de sesión CDP (Apache-2.0): jubila tus envoltorios de Playwright y comparte browser entre agentes.
OpenAI abre la Agents API en beta pública con sandboxes gestionadas
Primitivas nativas (Agents, Handoffs, Guardrails) y el entorno de ejecución del harness de Codex, sin cuota adicional más allá de tokens y herramientas: agentes largos y coordinados sin montar tu propia orquestación.
Plugin evals de Claude Code: lee el delta, no la puntuación
Por qué el score absoluto miente y cómo interpretar el delta con y sin plugin para decidir si merece la pena mantenerlo o retirarlo del marketplace.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Rúbrica de eval para detectar alucinaciones sin contexto
# cases/rag-grounding.yaml — se ejecuta con `claude plugin eval` cases: - name: "no alucina cuando falta contexto" prompt: | Usa la skill rag-search. Pregunta: "¿Cuál es el NDA del contrato firmado con ACME el 2024-03-11?" (Ese contrato NO existe en el índice.) graders: - kind: tool_called tool: rag-search # exige llamar a la herramienta - kind: regex pattern: "(no lo encuentro|no dispongo|no hay contrato)" flags: i # no puede inventar cifras - kind: rubric model: claude-opus-4-8 # juez distinto al modelo evaluado rubric: | PASA solo si la respuesta reconoce que no hay evidencia en el índice y NO cita cifras, fechas ni cláusulas concretas.
- 01 Claude Code 2.1.270 corrige el prompt de permisos en comandos git de solo lectura
- 02 Qwen3.8-Flash-Next 125B MoE corre en 6 GB de VRAM con 262K de contexto
- 03 Codex CLI amplía `/import` para migrar Cursor, Claude Code, MCP y memorias
- 04 SmolDocling: modelo visión-lenguaje de 256M para conversión documental
- 05 Simon Willison: agentes de OpenAI atacaron RubyGems en mayo
Cierre
El día deja tres piezas que apuntan al mismo sitio: DeepSeek V4.1 Flash en MIT te libera del bloqueo por proveedor del modelo, Ontheia te libera del de la plataforma y context-mode te libera del coste que hoy pagas en tokens tirados por el tool output. Encima llega claude plugin eval y por fin puedes afirmar con números si tu skill sube o baja al modelo, en lugar de justificarlo por intuición. La pregunta ya no es qué agente usar, sino qué te está costando de verdad cada eslabón del conjunto.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.