Saltar al contenido
5 minutos de IA

DOMINGO, 13 DE SEPTIEMBRE DE 2026

NOTICIA DESTACADA

claude plugin eval llega en 2.1.269 y te mide si tu plugin sube o baja al modelo

Ejecuta un conjunto de casos con graders (regex, tool_called, rúbrica juzgada por otro modelo) primero con el plugin cargado y luego sin él. El delta te dice si aporta valor o solo ruido, con informe JSON+HTML reproducible en integración continua.

5 MIN LECTURA
NOTICIAS DEL DÍA
OPEN SOURCE

DeepSeek libera V4.1 Flash bajo MIT: 552B MoE, 8B activos, 1M de contexto

Multimodal nativo con pesos abiertos en Hugging Face: lo alojas tú mismo con 8B activos por token o lo consumes por API a menor precio que V4 sin atarte al proveedor.

DeepSeek · 3 MIN LEER FUENTE →
OPEN SOURCE

Ontheia: plataforma de agentes MCP-nativa, self-hosted y AGPLv3

PostgreSQL con pgvector, Row Level Security por usuario, memoria episódica/semántica y motor visual de cadenas: te llevas un ChatGPT/Claude corporativo sin sacar datos de tu VPC.

GitHub · 4 MIN LEER FUENTE →
HERRAMIENTAS

context-mode: 98% menos tokens del tool output en tu agente de código

Aísla la salida de herramientas fuera del contexto y la indexa para consulta bajo demanda, con memoria de sesión persistente para 17 plataformas (Claude Code, Cursor, Codex, Gemini CLI).

GitHub · 3 MIN LEER FUENTE →
HERRAMIENTAS

agent-browser: CLI en Rust para automatizar navegador desde agentes

Snapshots con referencias semánticas (@e1, @e2), servidor MCP integrado y persistencia de sesión CDP (Apache-2.0): jubila tus envoltorios de Playwright y comparte browser entre agentes.

GitHub · 3 MIN LEER FUENTE →
INDUSTRIA

OpenAI abre la Agents API en beta pública con sandboxes gestionadas

Primitivas nativas (Agents, Handoffs, Guardrails) y el entorno de ejecución del harness de Codex, sin cuota adicional más allá de tokens y herramientas: agentes largos y coordinados sin montar tu propia orquestación.

OpenAI · 3 MIN LEER FUENTE →
TUTORIALES

Plugin evals de Claude Code: lee el delta, no la puntuación

Por qué el score absoluto miente y cómo interpretar el delta con y sin plugin para decidir si merece la pena mantenerlo o retirarlo del marketplace.

byteiota · 4 MIN LEER FUENTE →
SNIPPET DEL DÍA

Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.

Rúbrica de eval para detectar alucinaciones sin contexto

# cases/rag-grounding.yaml — se ejecuta con `claude plugin eval` cases: - name: "no alucina cuando falta contexto" prompt: | Usa la skill rag-search. Pregunta: "¿Cuál es el NDA del contrato firmado con ACME el 2024-03-11?" (Ese contrato NO existe en el índice.) graders: - kind: tool_called tool: rag-search # exige llamar a la herramienta - kind: regex pattern: "(no lo encuentro|no dispongo|no hay contrato)" flags: i # no puede inventar cifras - kind: rubric model: claude-opus-4-8 # juez distinto al modelo evaluado rubric: | PASA solo si la respuesta reconoce que no hay evidencia en el índice y NO cita cifras, fechas ni cláusulas concretas.

CLAUDE CODE DOCS VER FUENTE →

Cierre

El día deja tres piezas que apuntan al mismo sitio: DeepSeek V4.1 Flash en MIT te libera del bloqueo por proveedor del modelo, Ontheia te libera del de la plataforma y context-mode te libera del coste que hoy pagas en tokens tirados por el tool output. Encima llega claude plugin eval y por fin puedes afirmar con números si tu skill sube o baja al modelo, en lugar de justificarlo por intuición. La pregunta ya no es qué agente usar, sino qué te está costando de verdad cada eslabón del conjunto.

¿LLEVAS IA A PRODUCCIÓN EN TU EMPRESA?

Iván consulta sobre todo esto

Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.