DOMINGO, 2 DE AGOSTO DE 2026
Supabase Evals: benchmark Apache 2.0 que puntúa a Claude Code, Codex y OpenCode contra tareas Supabase reales
Framework que ejecuta agentes contra pilas Supabase reales en contenedores Docker (nada de mocks) — construir un esquema, depurar una Edge Function, arreglar una política RLS rota — y mezcla checks deterministas con LLM-as-a-judge, una sola reintenta. Con `pnpm eval --experiment claude-code-sonnet-5` sabes qué agente rinde en tu conjunto de herramientas antes de dejarlo tocar producción, en vez de creerte la leaderboard genérica.
5 MIN LECTURADatasette Agent estrena browser_task: las herramientas del agente ya ejecutan JavaScript en el navegador del usuario
Simon Willison mete `await context.browser_task()` con suspender/reanudar duradero, at-most-once y API pública de completado. Sales del bucle en el que el agente pide al usuario que copie y pegue: ejecutas código en su sesión real, capturas el resultado y sigues sin exponer credenciales del backend.
GitHub abre stacked pull requests en preview pública con gh-stack
Nueva extensión oficial `gh extension install github/gh-stack` que crea, rebases y navega la pila desde la web, la CLI, la app móvil y los agentes tipo Copilot vía la skill `gh-stack`. `gh stack merge` fusiona la pila entera en una operación atómica: si un PR falla el merge, no aterriza ninguno.
EU AI Act: hoy son exigibles las obligaciones de alto riesgo y la Comisión Europea abre su Compliance Checker
Documentación técnica, gestión de riesgos, registros y supervisión humana pasan a ser obligatorios para sistemas de Anexo III desde hoy. El AI Act Service Desk publica un Compliance Checker interactivo: describes tu producto y te devuelve las obligaciones concretas antes de que un cliente de la UE te lo pregunte.
Microsoft Agent Governance Toolkit v4.1: política determinista sobre las 10 OWASP Agentic y módulo de EU AI Act
Primer paquete abierto (MIT) que cubre los 10 riesgos OWASP para agentes y automatiza el checklist del EU AI Act, HIPAA y SOC 2. Se instala con `pip install 'agent-governance-toolkit[full]'` y envuelve tus herramientas con `govern()`: el sandbox bloquea la acción antes de ejecutarla, no después de tirarte producción.
TencentDB Agent Memory llega a 10,4k estrellas: memoria local en 4 niveles para agentes, sin APIs externas
Pipeline L0→L3 (Conversación, Átomo, Escenario, Persona) que reporta 61% menos tokens y sube el pass rate de WideSearch de 33% a 50% cuando lo enchufas a OpenClaw. `./start-all.sh` levanta la pila completa y expone Chat Memory, Skills, Wiki y CodeGraph como memory assets con ACL por agente.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Correr Supabase Evals contra Claude Code Sonnet 5 en local
# Clonar con submodulos (arrastra supabase/agent-skills como submodulo). git clone --recurse-submodules https://github.com/supabase/evals cd evals && pnpm install cp .env.example .env # ANTHROPIC_API_KEY, SUPABASE_ANON_KEY, etc. # Correr un solo eval contra un experimento concreto (agente + modelo). # Los experimentos ya definidos incluyen claude-code-sonnet-5, codex y opencode. pnpm eval -- \ --eval resolve-dataapi-001-empty-results \ --experiment claude-code-sonnet-5 # Correr todos los evals del experimento y abrir el dashboard local # con puntuacion deterministica + LLM-as-a-judge (una sola reintenta). pnpm eval -- --experiment claude-code-sonnet-5 pnpm export-results && pnpm web # sirve el dashboard en localhost:3000 # Comprobar que un eval nuevo encaja en el schema antes del PR. pnpm check
- 01 Anthropic pone Claude Sonnet 5 como modelo por defecto en Claude Code con ventana de 1M tokens
- 02 Cursor para iPad ya disponible en todos los planes de pago
- 03 Claude Code añade autocompletado de shortcodes emoji y controles finos para sub-agentes y presupuestos
- 04 huggingface/speech-to-speech: construye agentes de voz locales con modelos de código abierto
- 05 bytedance/deer-flow vuelve al trending: harness SuperAgent MIT con sub-agentes, sandboxes Docker y memoria persistente
Cierre
El día 101 aterriza sobre una idea que llevaba semanas cocinándose: la gobernanza del agente pasa de charla de conferencia a artefacto instalable. Supabase Evals deja de puntuar modelos y empieza a puntuar agentes contra tu propia pila; Microsoft Agent Governance Toolkit convierte los 10 OWASP Agentic en política determinista con un pip install; y el EU AI Act exigible desde hoy convierte “tener logs” en obligación contractual, no en buena práctica. Al lado, Simon Willison enseña la primitiva que faltaba (browser_task) para que el agente ejecute código en el navegador del usuario sin proxies frágiles, y gh-stack oficializa el flujo de stacked PRs que Copilot ya sabe usar como skill. Se cierra el ciclo: menos wrappers, más contratos y más medición desde el primer commit.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.