LUNES, 17 DE AGOSTO DE 2026
DeepSeek sube precios API hasta 1100% con horario peak/off-peak: la caché de contexto es tu salida
Efectivo desde ayer 16:00 UTC: V4-Pro pasa a $3.96/M output en peak y $1.98/M en off-peak (peak 01:00–04:00 y 06:00–10:00 UTC). El cache-hit sigue a $0.014/M: si reutilizás system prompt y few-shots, cacheás ~92% del contexto y anulás el 90% del sobrecoste sin migrar de modelo.
5 MIN LECTURAAnthropic retira hoy el Workbench legacy y las prompt tools API experimentales
Cierre de /v1/experimental/prompt_generator, /prompt_improver, /prompt_templatizer y de prompts, versiones y evals del Workbench legacy. Si tenías scripts colgados, migran o rompen producción hoy.
Ollama estrena `ollama launch dsh` para DeepSeek Harness y web search en Responses API
`ollama launch dsh` arranca DeepSeek Harness contra Ollama con web search integrado; `ollama launch muse` hace igual con Muse Code y la Responses API gana búsqueda web nativa. Agente local sin token externo.
DeepSeek V4-Pro ya habla Responses API: enchufás Codex CLI con 6 líneas de config.toml
V4-Pro habla nativo la Responses API en api.deepseek.com. Codex CLI arranca con un `model_providers` de 6 líneas apuntando al endpoint: misma cadena de herramientas sin lock-in a OpenAI y sin proxy intermedio.
Cursor activa Cloud Agent Builds por defecto desde hoy: arranque 3x y sin re-setup
Cada entorno usa builds precocinados desde hoy sin coste extra: el agente arranca 3x más rápido y retoma el último build sano si el entorno rompe. Fin del `pnpm install` por sesión.
Anthropic amplía la Compliance API a Cowork y Claude Code en beta para Enterprise
Nuevos endpoints devuelven transcripción por sesión (prompts, respuestas y actividad de tools) de Claude Code CLI/desktop y Cowork. Auditoría y eDiscovery en el pipeline que ya usás para chats.
Z.ai retrasa dos semanas los pesos abiertos de GLM-5.3 por revisión de ciberseguridad
GLM-5.3 (743B) se queda en API y ZCode: Z.ai valida sus 2 436 hallazgos de vulnerabilidades antes de publicar los pesos. Autoalojar esta semana se cancela: mínimo, 28 de agosto.
Una técnica, prompt o comando aplicable hoy. Cópialo, pruébalo en tu stack en menos de 5 minutos y reenvíalo a un colega si te resulta útil. Ejemplos típicos: un prompt para evals, un patrón de agente, un comando que recorta tokens o un truco de RAG.
ollama launch dsh: DeepSeek Harness local en un comando
# Nuevo en Ollama (agosto 2026): un unico comando arranca # DeepSeek Harness (Web UI en http://127.0.0.1:3080) contra # el servidor de Ollama, con el plugin de web search integrado # y trajectory view (tools, pasos, tokens) sin instrumentacion extra. ollama launch dsh # Precondicion: el modelo que use el agente ya descargado ollama pull qwen3:27b # o el que uses en dsh OLLAMA_MODEL=qwen3:27b ollama launch dsh # Muse Code (agente de coding de Meta Superintelligence) # se arranca del mismo modo, como CLI en la terminal: ollama launch muse # Verificar que la API OpenAI-compatible de Ollama expone # ya el endpoint de web search nativo (Responses API): curl -s http://127.0.0.1:11434/v1/responses \ -H 'Content-Type: application/json' \ -d '{"model":"qwen3:27b","input":"noticias IA hoy","tools":[{"type":"web_search"}]}'
- 01 Cursor detalla los nuevos Builds: boot interno 10x, TTFT 3x, activados por defecto el 17
- 02 Claude Code sandbox credential-masking gana JWT decode y AWS SigV4 re-signing
- 03 DeepSeek V4-Pro-0813 estrena DSpark speculative decoding y niveles low/high/max de reasoning
- 04 Ollama X: `ollama launch dsh` incluye plugin de web search preinstalado
- 05 Anthropic abre Claude for Government en beta sin exigir contrato aparte con proveedor cloud
Cierre
Hoy la señal es un mercado que ya no absorbe el precio del token frontier sin pelear. DeepSeek cuadruplica su tarifa y la parte en peak/off-peak, y la única forma sensata de sobrevivir es tratar la caché de contexto como infraestructura de primera clase: cache_control, prompts sistema estables y few-shots inmutables. En paralelo, Ollama te da el sustituto local en un solo comando con DeepSeek Harness y Muse Code, Cursor normaliza los builds precocinados para agentes cloud y Anthropic consolida gobierno y auditoría con Compliance API sobre Cowork y Claude Code. Con Z.ai paralizando los pesos abiertos de GLM-5.3 por hallazgos de seguridad, queda claro qué distingue esta fase: no es la calidad del modelo, sino la disciplina de la tubería que lo llama.
Iván consulta sobre todo esto
Ingeniero IA con 3 años llevando LLMs a producción y más de 15 construyendo producto para Openbank, Inditex e Iberia. Agentes autónomos, RAG auditable: del piloto al despliegue real.