MARTES, 1 DE SEPTIEMBRE DE 2026
DeusData/codebase-memory-mcp: grafo persistente del repo que baja 99,2% los tokens de exploración
Servidor MCP en un binario estático que indexa el repo con tree-sitter en 162 lenguajes y LSP híbrido en 12: 5 consultas estructurales gastan 3,4k tokens en vez de 412k por exploración archivo a archivo (benchmark en 31 repos, 83% de calidad, 2,1× menos llamadas a herramientas). Bajas factura y consumes menos contexto sin cambiar de agente.
4 MIN LECTURAOpenAI Codex CLI 0.152.0 abre búsqueda vim /? en drafts, límites de tokens por tool MCP y timeouts de shell >1h
Búsqueda vim `/?` con highlight y `n`/`N` en drafts, límites de tokens configurables por tool MCP para cortar respuestas ruidosas y comandos de shell con timeout >1h desde app-server: pipelines largos sin cortes y menos tokens desperdiciados.
Claude Code 2.1.252 estabiliza Remote Control con redes flakey y persiste 'always allow' sin settings.local.json
Corrige `always allow` sin `settings.local.json`, tareas Bash con 'task output swap refused' en Mac y cuelgues de Remote Control tras un tool con red inestable. Actualización silenciosa pero obligatoria si operas el CLI en equipos con red variable.
firecrawl/pdf-inspector clasifica páginas PDF en 10-50 ms y solo enruta a OCR/VLM las escaneadas
Librería en Rust (con bindings pip y npm) que detecta texto vs. escaneado por fuentes y operadores en 10-50 ms sin renderizar. Enruta a un modelo caro solo lo que hace falta: ~54% de tus PDFs no lo necesitan.
Heretic decensora LLMs de pesos abiertos sin ajuste fino con Optuna TPE y divergencia KL baja
CLI que suprime rechazos en modelos densos por ablación direccional + TPE de Optuna: Gemma 3 12B iguala abliteraciones manuales con KL 0,16 vs 0,45-1,04. Base sólida para red team y evaluar tu capa de safety en modelos locales. AGPL-3.0.
ai-evals-course/evals-skills: skills para escribir jueces LLM y calibrarlos contra etiquetas humanas
Hamel Husain y Shreya Shankar publican `write-judge-prompt` (criterio binario, few-shots solo de train) y `validate-evaluator` (TPR/TNR contra humanos). Deja de confiar en jueces LLM sin calibrar dentro de tu pipeline de evaluación.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
Contextualizar el fragmento antes de embeber (Anthropic)
# Prompt de "Contextual Retrieval" de Anthropic: genera 50-100 tokens de # contexto por fragmento y los antepone antes de embeber e indexar en BM25. # En su benchmark baja el "retrieval failure" 35-49% frente a chunking plano. # Ejecútalo con Haiku + prompt caching sobre el documento entero: barato. <document>{{DOCUMENTO_COMPLETO}}</document> Este es el fragmento a situar dentro del documento: <chunk>{{FRAGMENTO}}</chunk> Da un contexto sucinto que sitúe este fragmento dentro del documento completo para mejorar su recuperación por búsqueda. Responde SOLO con el contexto (50-100 tokens) y nada más. # Después: indexa `contexto + "\n\n" + fragmento` tanto en el store # de embeddings como en el índice BM25 (recuperación híbrida).
- 01 Codex CLI 0.152 endurece Guardian approval reviews con retención de mensajes y progress indicators de reauth Bedrock
- 02 jingyaogong/minimind: entrena un LLM de 64M parámetros en 2h por ~0,43 $ con PyTorch puro (SFT, LoRA, DPO/PPO/GRPO)
- 03 Simon Willison publica TIL: `rg | llm` para responder preguntas sobre un codebase con citaciones file:line
- 04 Codex CLI 0.152 acepta nombres MCP con `:`, `@`, `/` y `.` — fin del ruido al registrar paquetes
- 05 Anthropic mantiene Contextual Retrieval como default RAG de 2026 antes de meter reranker
Cierre
El hilo del día es explícito: sacar más trabajo fuera del contexto del modelo. DeusData/codebase-memory-mcp convierte cinco consultas al repo en 3,4k tokens en vez de 412k, firecrawl/pdf-inspector decide qué páginas hace falta enviar al VLM antes de gastar en OCR, y el prompt de Contextual Retrieval de Anthropic contextualiza fragmentos antes de embeber para no perderlos en la recuperación. Alrededor, OpenAI Codex y Claude Code siguen puliendo el entorno de ejecución (búsqueda vim, límites por tool MCP, always allow que persiste, Remote Control estable), y Hamel & Shreya publican los skills para dejar de confiar en jueces LLM sin calibrar. Menos tokens al modelo, más gobernanza fuera de él: eso es lo que hoy toca meter en producción.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.