MARTES, 28 DE JULIO DE 2026
MCP 2026-07-28 sale hoy en GA: adiós al handshake y al Mcp-Session-Id, servidores remotos que escalan tras round-robin
La revisión definitiva del Model Context Protocol convierte el núcleo en stateless: fuera fase de initialize, fuera Mcp-Session-Id, y tools/list cacheable durante el ttlMs que declares. Tu servidor MCP remoto ya escala tras un balanceador plano sin session affinity ni Redis compartido, y las betas oficiales (@modelcontextprotocol/server 2.0.0-beta.1 y equivalentes en Python, Go y C#) están listas para que migres esta semana.
5 MIN LECTURAMoonshot abre los pesos de Kimi K3: 2,8T parámetros MoE con 1M de contexto en huggingface.co/moonshotai
Los safetensors nativos en MXFP4 (~1,4 TB descomprimidos) están descargables desde ayer 00:00 UTC bajo Apache 2.0. Autoalojas el mayor modelo de pesos abiertos publicado hasta la fecha y dejas de mandar prompts a la API en Pekín: cortas el riesgo de exfiltración de datos y bajas el suelo de coste para RAG y agentes de código de larga duración.
codebase-memory-mcp: MCP server que indexa el repo en un grafo y baja 99% los tokens de exploración
Binario Go estático, cero dependencias, 158 lenguajes. Indexa el kernel de Linux (28M LOC) en 3 minutos y responde consultas estructurales (llamadores, referencias, definiciones) por debajo del milisegundo. Cinco consultas ~3.400 tokens frente a ~412.000 con grep en fichero por fichero: sustituye al patrón `Explore` en Claude Code, Codex y Cursor y elimina el impuesto de tokens en agentes largos.
Anthropic elimina el 80% del system prompt de Claude Code sin perder puntos en evals
El post de context engineering para Claude 5 codifica seis giros aplicables ya: pasar de reglas a criterio, de ejemplos a interfaces autodescriptivas, de contexto anticipado a divulgación progresiva y de memoria manual a auto-memoria. El comando `/doctor` en Claude Code audita tus skills y CLAUDE.md y te enseña qué recortar. Menos tokens por turno, mejor obediencia y menos deuda oculta en prompts.
Cursor 3.7 estrena Design Mode: editas HTML del navegador señalando elementos y con multi-selección para batch-edit
El agente de Cursor lee el DOM del navegador integrado, capta código, posición y relaciones de los elementos que marcas y ejecuta comparaciones, alineados o cambios por lote sobre varios a la vez. Añade narración por voz mientras trabaja e informe interactivo de uso de contexto. Menos tiempo describiendo qué mover en el CSS y más señalando.
Un dev mete un LLM de 28,9M parámetros en un ESP32-S3 de 8 dólares: 9,5 tokens/s completamente offline
Aprovecha las per-layer embeddings de Gemma: la tabla de 25M parámetros vive en flash memory-mapped (XIP) y solo carga ~6 filas (~450 bytes) por token, el núcleo denso de ~560K queda en RAM. Cien veces más grande que el anterior récord en esa clase de chip. Proyecto abierto y reproducible: agentes de voz, sensores y wearables sin red ni facturación de API.
OpenAI lleva ChatGPT Voice full-duplex al desktop de macOS y Windows: hablas al agente y ves a Codex trabajar en directo
GPT-Live coordina múltiples agentes de Codex y ChatGPT Work desde el desktop build 26.715: lanzas tareas, las interrumpes y apruebas acciones sin soltar el teclado. Disponible en Plus, Pro, Business, Edu y Enterprise. Recorta el ciclo de contexto en pair-programming asíncrono: pides una investigación mientras revisas otro PR.
Debian abre votación general sobre el uso de LLMs en contribuciones: tres propuestas, dos semanas de debate
La resolución empezó a discutirse el 24 de julio con tres opciones sobre la mesa: prohibición total, aceptación regulada (con obligación de declarar la asistencia y responsabilidad del contribuidor) y rechazo práctico. Si prospera la A, los mantenedores que usen Copilot, Claude Code o Codex quedan fuera de golpe; si prospera la B, cualquier PR con IA lleva declaración obligatoria.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Instalar codebase-memory-mcp en Claude Code y bajar 99% los tokens de exploración
# Binario Go estatico, sin Docker, sin API keys. # El instalador auto-detecta Claude Code, Codex CLI, Cursor, Windsurf, # Gemini CLI, VS Code y Zed; registra el MCP en cada uno y deja el # binario en PATH. curl -fsSL https://raw.githubusercontent.com/DeusData/codebase-memory-mcp/main/install.sh | bash # Indexa el repo actual en un grafo persistente (SQLite embebido). # El kernel de Linux (28M LOC) tarda ~3 min; un monorepo medio, segundos. cd ~/proyectos/tu-repo codebase-memory index . # Consulta estructural desde la CLI para verificar antes de usar el MCP. # 5 consultas ~3.400 tokens frente a ~412.000 con grep fichero a fichero. codebase-memory query "callers of parseConfig" codebase-memory query "definition of UserService" # Dentro de Claude Code, comprueba que el server esta registrado. # Debe aparecer `codebase-memory` con status `ready`. claude mcp list # A partir de aqui, cuando el agente necesite ubicar codigo o entender # referencias, llama al MCP en vez de leer ficheros enteros.
- 01 SDKs beta oficiales de MCP 2026-07-28 en Python, TypeScript, Go y C#
- 02 Tobi Knaup: 'Open-weight AI está en su momento Kubernetes, no lo estropeemos'
- 03 NVIDIA Cosmos 3 Edge (4B) en Hugging Face con pesos, inferencia y post-training
- 04 MCP Apps: primera extensión oficial con UI server-rendered en iframe sandboxed
- 05 Muse Spark 1.1 (Meta) ya lanzado con API pública, 1M de contexto y sub-agentes en paralelo
Cierre
Hoy es el día de MCP: la spec 2026-07-28 sale en GA y convierte al protocolo en apátrida, con clientes que cachean tools/list y servidores que escalan tras un balanceador plano; el impuesto de sesión desaparece. Al mismo tiempo, Kimi K3 abre 2,8T parámetros bajo Apache 2.0 y codebase-memory-mcp demuestra que un MCP bien pensado recorta 99% de tokens sustituyendo al patrón Explore. Añade que Anthropic ha borrado el 80% del system prompt de Claude Code sin perder puntos: la dirección es clara, menos handshakes, menos ejemplos, menos contexto anticipado y más criterio, más interfaces autodescriptivas, más divulgación progresiva. Si tu agente sigue asumiendo sesión, cargando el repo por fichero o rellenando el prompt de “no hagas X”, lleva un año de retraso.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.