DOMINGO, 16 DE AGOSTO DE 2026
Alibaba libera Qwen 3.8-27B multimodal bajo Apache 2.0 con 262K de contexto y 1M via YaRN
27B densos con visión integrada, 262K de contexto nativo escalables a 1M via YaRN factor 4.0 y arquitectura híbrida Gated DeltaNet + Gated Attention. Soporte día-0 en vLLM, SGLang, AMD ROCm y Unsloth GGUF: enchufas un multimodal frontier a tu stack RAG local sin pagar API ni depender de proveedor cerrado.
5 MIN LECTURAAlibaba abre también los pesos del MoE Max Qwen 3.8-2.4T-A95B con inferencia día-0 en vLLM
MoE Max de la misma generación bajo Apache 2.0 con soporte día-0 documentado en el blog oficial de vLLM. Alternativa open source al top-tier de OpenAI, Google y Anthropic sin lock-in de API cuando necesitás máxima capacidad en inferencia auto-alojada.
Claude Code v2.1.229 estrena plugin marketplace por comando: el IDE regenera el plugin cada sesión
Nuevas fuentes de plugin `command` con `mode: "link"`: un comando local (tu IDE) imprime el directorio del plugin y Claude Code lo reejecuta en segundo plano cada sesión sin reinstalar. Elimina la fricción de repackage al cambiar de toolchain.
Claude Code v2.1.233 añade merge requests de GitLab, memory cgroup en Bash y cache TTL configurable en WebFetch
MRs de GitLab en `--worktree`, opt-in `CLAUDE_CODE_TOOL_MEMORY_LIMIT` con cgroups para que un build runaway no coma la sesión, `CLAUDE_CODE_WEBFETCH_CACHE_TTL_MS` para ajustar caché y fix a MCP v2 en hosts serverless. Gobernanza y estabilidad para agentes de larga vida.
Google libera HEIR: compilador MLIR open source para inferencia sobre datos cifrados con FHE
Compilador MLIR de Google para fully homomorphic encryption: `pip install heir_py` con backends OpenFHE y Lattigo. Ejecutás inferencia sobre inputs cifrados sin descifrar en el servidor: primer paso viable a un pipeline de recomendación o fraude que nunca ve tus datos en claro.
Hugging Face publica State of Open Models Summer 2026: los agentes son ya el usuario #1 del Hub
Informe semestral: los agentes lideran el tráfico del Hub por primera vez, los modelos <1B se llevan el 83% de descargas totales y los OW chinos superan a los estadounidenses (41%). Señal para decidir si construís agentic con modelo pequeño self-hosted o pagás API frontier.
Unsloth publica Qwen 3.8-27B GGUF con Dynamic V3.0: cuantización dinámica lista para llama.cpp día-1
GGUFs listos día-1 con Dynamic V3.0 preview (IQ4_NL, IQ4_XS, Q3_K_M, Q3_K_S): corrés Qwen 3.8-27B en llama.cpp con soporte MTP para inferencia rápida y toggles de reasoning. Baja el bill de agentes locales sin renunciar a la calidad del 27B denso.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
marketplace.json con source command (mode link) para plugins de tu IDE
// .claude-plugin/marketplace.json // Claude Code >= 2.1.229 (12 ago 2026). Tu IDE imprime la ruta del // plugin renderizado para el toolchain activo; Claude Code reejecuta // el comando en segundo plano al inicio de cada sesion y usa el // directorio en su sitio (sin copiar a cache ni hashear contenido). // Elimina el repackage al cambiar de stack. { "name": "mi-ide-plugins", "owner": {"name": "Mi Empresa"}, "plugins": [ { "name": "sdk-actual", "description": "Plugin generado por mi IDE para el toolchain activo", "source": { "source": "command", "command": "my-tool claude-plugin-path", "mode": "link", "timeout": 30 } } ] } # Instalar (una sola vez desde el repo con el marketplace.json): /plugin marketplace add ./ruta/al/repo /plugin install sdk-actual@mi-ide-plugins # Notas: mode "link" no funciona en Windows (usa "copy" alli). # Los admins pueden bloquearlo con la managed setting # "disableCommandPluginSources". El comando debe imprimir una unica # linea en stdout con la ruta absoluta y salir con codigo 0; Claude # Code lo re-ejecuta al inicio de cada sesion sin reinstalar el plugin.
- 01 AMD ofrece día-0 para Qwen 3.8 en Instinct MI300X, MI325X y MI355X con SGLang y vLLM
- 02 vLLM publica recipe oficial para Qwen 3.8-27B con --max-model-len y YaRN factor 4.0
- 03 vLLM blog: soporte día-0 para el MoE Qwen 3.8-2.4T-A95B
- 04 Claude Code v2.1.232 activa subagent_type "fork" por defecto y @-mention entre sesiones
- 05 NVIDIA y Hugging Face amplían LeRobot con Isaac GR00T 1.7 y anuncian Cosmos 3
Cierre
Hoy la señal es un ecosistema open source que ya no cede terreno. Alibaba publica Qwen 3.8-27B multimodal bajo Apache 2.0 con soporte día-0 en vLLM, AMD ROCm, SGLang y Unsloth: modelo frontier auto-alojado sin pagar tokens ni depender de proveedor cerrado. En paralelo, Claude Code abre las fuentes de plugin command para que tu IDE regenere en sesión sin repackage, y Google HEIR publica su compilador MLIR para inferencia sobre datos cifrados. El ancho de banda entre modelo, tooling y pipeline de datos deja de estar cerrado — y con ello desaparece la última justificación técnica para el lock-in.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.