NeuralOS
Modelos

DeepSeek estrena precios por hora punta: la API que se encarece dos veces al día

DeepSeek V4 introduce tarificación por franja horaria: en dos ventanas diarias los tokens —entrada y salida— cuestan el doble, y bajan fuera de pico. Es la primera vez que un gran laboratorio cobra 'por reloj', al estilo del surge pricing de Uber. La inferencia empieza a comportarse como la electricidad.

EN
Equipo NeuralOS
Radar de IA
Jul 1, 20264 min de lectura
En resumen

DeepSeek V4 estrena tarificación por franja horaria: en dos ventanas diarias sus tokens —entrada y salida— cuestan el doble y bajan fuera de pico. La inferencia empieza a cobrarse como la electricidad, y presupuestar IA pasa de 'cuántos tokens' a 'a qué hora'.

Imagina abrir la consola de tu proveedor de IA a las diez de la mañana y descubrir que la misma llamada que anoche costaba un peso hoy cuesta dos. No hay letra pequeña ni penalización oculta: es, sencillamente, la hora. DeepSeek acaba de anunciar exactamente eso. Con su modelo V4, el laboratorio chino introduce tarificación por franja horaria a partir de mediados de julio: en dos ventanas diarias —de 9:00 a 12:00 y de 14:00 a 18:00, hora de Pekín— el precio se duplica, y fuera de esos picos vuelve a bajar. Es la primera vez que un gran laboratorio cobra literalmente por reloj.

## Uber, pero para pensar

El mecanismo es idéntico al surge pricing que ya conoces de Uber o de la tarifa eléctrica por horas: cuando la demanda sube, sube el precio; cuando baja, baja. En números concretos, la versión V4-Pro pasa de 6 a 12 yuanes por millón de tokens de salida en hora punta (unos 1,70 dólares en pico); la V4-Flash, de 2 a 4. Y aquí está el matiz que conviene no equivocar: el recargo no cae solo sobre lo que el modelo genera. Según The Next Web, en las ventanas de pico **también se duplica el precio de la entrada**, los tokens que tú le mandas. Fuera de pico, no se mueve nada. DeepSeek no lo esconde como un truco: lo presenta como una señal de precio para que quien pueda desplace su carga a las horas valle y libere GPUs cuando todo el mundo se las pelea.

## Por qué un laboratorio se atreve a esto

Detrás de la ocurrencia hay física, no marketing. Servir un modelo grande es un problema de capacidad: hay un número finito de GPUs y, en el horario de oficina asiático, todas se saturan a la vez. Cobrar más en pico y menos en valle es la forma más honesta de decir 'ahora mismo no tengo sitio; vuelve luego y te sale la mitad'. Es la misma lógica por la que la luz cuesta distinto a las tres de la tarde que a las tres de la madrugada. Y el giro es notable porque DeepSeek venía de lo contrario: acababa de hacer permanente un descuento del 75% en V4, tras un año socavando los precios de la competencia. Pasar de regalar tokens a cobrar por reloj, en cuestión de semanas, dice mucho sobre lo cara que se ha vuelto la capacidad de cómputo.

## La factura ya no depende solo de cuánto, sino de cuándo

Para quien construye software sobre estas APIs, el cambio es más profundo de lo que parece. Hasta ahora, presupuestar IA era multiplicar tokens por un precio fijo. Con precios dinámicos, esa cuenta se convierte en un problema de scheduling: una tarea batch que no le corre prisa a nadie —reprocesar documentos, generar embeddings, resúmenes nocturnos— puede costar la mitad si la programas para las horas valle en lugar de dispararla a mediodía. Y al revés: una integración que ignora el reloj puede duplicar su factura sin que nadie lo note, porque el código funciona igual de bien; solo cambia el extracto. La inferencia empieza a comportarse como una utility, y las utilities se gestionan con disciplina horaria, no con esperanza.

## Qué significa para quien construye con IA

La lección es incómoda pero liberadora: si tu producto vive de llamar modelos, el coste ya no es un dato que miras a fin de mes, es una palanca que operas en tiempo real. Eso exige dos cosas que hasta ayer eran opcionales: guardarraíles de coste que entiendan el contexto —no solo 'cuántos tokens', sino 'a qué precio ahora'— y la capacidad de mover hacia las horas baratas las cargas que no urgen. En NeuralOS trabajamos desde ese ángulo: los cost guardrails y el sistema de créditos existen para que una llamada cara no se te escape sin querer, y el motor de automations con waits durables permite diferir tareas batch a la ventana que elijas sin perder el hilo de ejecución. No prometemos negociar el reloj de cada proveedor por ti —eso sería humo—; lo que damos es el tablero para que 'cuándo' deje de ser una sorpresa en la factura y pase a ser una decisión tuya.

Compartir
¿Listo para construir?

Empieza a construir en
menos de 3 minutos

Únete a 4.200+ creadores. Sin tarjeta. Construye tu primera app con IA en minutos.