Con GPU Flow usas tarjetas gráficas (GPU) profesionales alojadas en España a través de internet, sin comprar hardware. Sobre ellas funcionan tres productos: Token Factory, una API para llamar a modelos de IA; los Sandboxes por SSH, máquinas Linux donde programas tú; y la GPU dedicada, una B200 entera (o una fracción) reservada solo para ti. Cada capítulo empieza desde cero; no hacen falta conocimientos previos.
GPU Flow tiene tres productos sobre la misma plataforma. Antes de entrar en detalle, esta es la diferencia esencial entre ellos y cuándo conviene usar cada uno.
0.1¿Para quién es?
No hace falta ser experto en infraestructura. GPU Flow está pensado tanto para quien programa como para quien solo necesita resultados:
Desarrollo
Quien crea producto
Quiere añadir IA a su app sin gestionar servidores. Cambia una URL en su código y empieza a llamar al modelo. → Token Factory.
Ciencia de datos
Quien entrena modelos
Necesita una GPU potente y dedicada para entrenar, hacer fine-tuning o cargas pesadas y sostenidas. → GPU dedicada.
Negocio
Quien decide y cumple
Le importa el coste, la factura en euros y que los datos cumplan el RGPD sin salir de la UE. Los tres productos lo garantizan.
Piénsalo así. Una GPU es como una cocina industrial: comprarla y mantenerla es carísimo y solo te compensa si cocinas sin parar. GPU Flow te la alquila por horas (la GPU dedicada) o te sirve los platos ya hechos a través de su API (Token Factory), pagando solo lo que consumes. El Sandbox es tu puesto de trabajo conectado a esa cocina.
0.2Cómo encaja todo
Los tres productos funcionan sobre la misma infraestructura soberana en España:
Token Factory
API: tu app llama por HTTP
Sandboxes
SSH: tu editor en el clúster
GPU dedicada
GPU B200 reservada para ti
Plataforma GPU Flow
El panel desde el que configuras y lanzas cada producto
Infraestructura
NVIDIA B200RDMADDN EXAScalerEspaña · UE
0.3¿Cuál elijo?
Si quieres…
Token Factory
Sandboxes
GPU dedicada
Llamar a un modelo desde tu app
✓
·
·
Una máquina Linux con SSH para programar
·
✓
·
Una GPU entera (o fracción) dedicada
·
·
✓
Entrenar o fine-tuning a gran escala
·
·
✓
Pagar por token consumido
✓
·
·
Pagar por horas activas
·
✓
✓
Datos 100 % en la UE
✓
✓
✓
¿Combinarlos? Es habitual: desarrollas en un Sandbox, entrenas en una GPU dedicada y sirves el modelo en producción vía Token Factory. Además ya están conectados por dentro: los asistentes de código de tu Sandbox (Claude Code, Open Code) pueden funcionar con modelos de Token Factory, y esos tokens se cobran dentro del consumo del propio Sandbox, no como un servicio aparte.
1
Capítulo 1 · Token Factory
Una API. SDKs que ya conoces.
Token Factory sirve modelos open source desde nuestra infraestructura en España a través de una API compatible con OpenAI y Anthropic. Un SDK es la librería que usas en tu lenguaje (Python, JavaScript, etc.) para hablar con una API; si ya usas el de OpenAI o Anthropic, solo cambias la URL base y tu clave, y el resto de tu código sigue igual.
En pocas palabras
Una API para usar modelos de IA por internet, sin instalar ni alojar nada. Pagas solo por lo que consumes, medido en tokens.
1.1¿Qué es una API de inferencia?
«Inferencia» es simplemente el momento en que un modelo de IA ya entrenado responde a una pregunta. Una «API» es la puerta por la que tu software le habla a otro software. Juntando ambas: tu aplicación envía una petición con tu texto, nuestro servidor se la pasa al modelo que corre en una GPU y te devuelve la respuesta, normalmente en menos de un segundo y, si quieres, palabra a palabra (streaming).
Lo bueno: como hablamos el mismo «idioma» que OpenAI y Anthropic, no reescribes tu código. Cambias la dirección a la que apunta y listo.
El recorrido de una petición (ida y vuelta):
1La petición viaja de tu app hasta el modelo
tu app
envía tu texto y tu clave
API GPU Flow
api.gpuflow.ai valida y enruta
modelo en GPU
genera la respuesta · España
2La respuesta hace el camino inverso hasta tu app
Respuesta el modelo devuelve el texto generado a tu app, palabra a palabra si activas el streaming.
¿Y los «tokens»? El modelo no lee letras ni palabras enteras, sino trozos llamados tokens (una palabra corta suele ser 1 token; una larga, 2-3). Cuentas tokens de entrada (lo que envías) y de salida (lo que responde). Así se calcula el precio:
Frase de ejemplo → «GPU Flow sirve modelos de IA desde España»
GpuFlowsirvemodelosdeIAdesdeEspaña
tokens ≈ 9precio entrada (DeepSeek V4 Pro) 0,42 €/Mcoste de esta frase ≈ 0,0000038 €
Piénsalo así. Los tokens son como los pasos de un taxímetro: no pagas por «viaje», pagas por la distancia real recorrida. Frases cortas cuestan céntimos de céntimo; el gasto solo se nota con mucho volumen.
Tres cosas que conviene entender del consumo por API:
1Entrada y salida se cobran por separado. La salida suele costar más por token: generar texto cuesta más que leerlo.
2Cada llamada es independiente. El modelo no recuerda nada entre peticiones. Si mantienes una conversación, reenvías el historial en cada llamada y ese historial también cuenta como tokens de entrada, así que las conversaciones largas consumen más.
3El streaming no cambia el precio. Pagas los mismos tokens; solo ves la respuesta aparecer antes, palabra a palabra.
Velocidad. Como los modelos se sirven desde nuestro clúster de GPU NVIDIA B200 en España, las respuestas empiezan a llegar en milisegundos y a gran número de tokens por segundo, sin la latencia de cruzar el Atlántico.
1.2Empieza en 3 minutos
1Recarga saldo
Elige un importe (desde 25 €) y paga con tarjeta, Apple Pay o Google Pay. El saldo se carga al instante. Cuanto más recargas, más bonus.
2Recibe tu API key
Tras el pago recibes un email para fijar tu contraseña. Tu clave aparece en el panel, con el prefijo gpf-. Cópiala: solo se muestra una vez.
3Apunta tu SDK
Cambia la base_url a api.gpuflow.ai/v1, pega tu clave y elige un modelo del catálogo. Ya estás haciendo inferencia.
1.3Tu primera llamada
Con el SDK de OpenAI en Python. Solo cambian dos líneas: base_url y api_key.
python · openai
from openai import OpenAI
client = OpenAI(
base_url="https://api.gpuflow.ai/v1",
api_key="gpf-...",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Hola, mundo"}],
stream=True,
)
for chunk in response:
print(chunk.choices[0].delta.content or "", end="")
¿Usas el SDK de Anthropic? También funciona: apunta a api.gpuflow.ai y usa el endpoint /v1/messages. Compatible con streaming SSE y function calling donde el modelo lo permite.
1.4Endpoints principales
POST/v1/chat/completionsChat · formato OpenAI
POST/v1/messagesChat · formato Anthropic
GET/v1/modelsLista de modelos disponibles
URL base: https://api.gpuflow.ai/v1 · autenticación con Authorization: Bearer gpf-…
1.5Catálogo de modelos
Modelos servidos hoy en España. Precios en EUR por millón de tokens, con IVA incluido, desglosados en entrada (tu prompt) y salida (la respuesta). El símbolo ★ marca los destacados.
A¿No sabes cuál? Empieza por un modelo ★ destacado (DeepSeek V4 Pro): equilibrio entre calidad y precio para la mayoría de tareas.
BMucho volumen o respuestas simples: elige un modelo pequeño (Qwen3.5 9B, Gemma 4 E2B): más barato y casi instantáneo.
CRazonamiento o código complejo: usa los grandes (DeepSeek V4 Pro, GLM 5.2 FP8). Cuestan más por token pero aciertan más.
Modelo
Capacidades
Entrada · €/M
Salida · €/M
DeepSeek V4 Pro★
ChatRazonamientoCódigoHerramientas
0,42 €
0,85 €
GLM 5.2 FP8★
ChatCódigoHerramientas
1,00 €
3,00 €
DeepSeek V4 Flash
ChatRazonamientoHerramientas
0,11 €
0,22 €
Qwen3.6 27B
ChatRazonamientoHerramientas
0,10 €
0,30 €
Qwen3 14B
ChatRazonamientoHerramientas
0,10 €
0,24 €
Qwen3.5 9B
ChatRazonamientoHerramientas
0,03 €
0,15 €
Gemma 4 E4B
ChatRazonamientoHerramientas
0,10 €
0,28 €
Gemma 4 E2B
ChatRazonamientoHerramientas
0,05 €
0,24 €
¿Necesitas otro modelo? Si encaja en la GPU, lo desplegamos; escríbenos a [email protected].
1.6Saldo y facturación
Modelo prepago: recargas cuando quieres y se consume según uso real (tokens). Cada recarga lleva factura española con IVA.
25 €
25 €
sin bonus
50 €
60 €
+10 € · +20%
100 €
120 €
+20 € · +20%
Mejor valor
500 €
650 €
+150 € · +30%
El importe que pagas se muestra arriba; el crédito que recibes incluye el bonus. ¿Volumen mayor o uso B2B? Hay tramos enterprise; consúltanos.
Ejemplo de coste. Procesar 500.000 tokens de entrada y generar 200.000 de salida con DeepSeek V4 Pro cuesta: (0,5 × 0,42 €) + (0,2 × 0,85 €) = 0,38 €. Sin tarifa por petición, sin mínimos.
2
Capítulo 2 · Sandboxes
Tu máquina Linux, por SSH.
Un Sandbox es un contenedor Linux con CPU, RAM y disco dedicados. Te conectas por SSH con tu propio editor o terminal, tus archivos viven en un volumen persistente, y la potencia de IA llega de Token Factory por red interna. Solo pagas las horas que el Sandbox está realmente activo.
En pocas palabras
Un Sandbox es un ordenador remoto al que te conectas por internet como si fuera tuyo, con CPU, RAM y disco dedicados. Eliges los recursos que necesites y, para tareas de IA, llamas a los modelos de Token Factory por la red interna. Cuando no lo usas se duerme solo y deja de cobrarte.
2.1¿Qué es un Sandbox?
Te conectas a él por SSH, una conexión segura, con tu propio editor o terminal, e instalas lo que necesites. Es ideal para desarrollar, ejecutar notebooks y conectar tus agentes a la inferencia, sin montar infraestructura.
La clave para no gastar de más es entender sus tres estados y qué se cobra en cada uno:
Activo
Encendido y trabajando. Te conectas y ejecutas tus procesos.
cobra compute + disco
Inactivo 30 min
Sin actividad tuya. A los 30 min se auto-suspende (o lo pausas tú).
aviso de inactividad
Suspendido
Dormido. Vuelve en 5-8 s al reconectar, con todo intacto.
solo cobra el disco
2.2Por qué sobre nuestro clúster
Un Sandbox de GPU Flow no es solo una máquina remota cualquiera: corre sobre el mismo clúster soberano que el resto de la plataforma, y de ahí salen sus ventajas.
Inferencia al lado
Compute dedicado y red interna RDMA de baja latencia hacia Token Factory: tus agentes llaman a los modelos sin salir a internet y sin la latencia de cruzar el Atlántico.
Datos a alta velocidad
Almacenamiento paralelo DDN EXAScaler para mover datasets y checkpoints grandes sin esperas. Y al reconectar, tu Sandbox reanuda en 5-8 s, sin arranques largos.
Privacidad por diseño
Tu código y tus datos viven en España, sobre hardware dedicado (no compartido con otros clientes), y no salen de la Unión Europea. Cumplimiento del RGPD sin transferencias internacionales.
Costes claros, en euros
Solo pagas las horas activas (al suspender, deja de cobrar compute) y siempre ves el coste estimado antes de confirmar. Factura española con IVA, sin conversión de divisa.
Más detalle sobre certificaciones y residencia de datos en la seguridad de la web.
2.3Conceptos clave
Sandbox
El contenedor donde trabajas: CPU, RAM y disco dedicados. Puede estar activo, pausado o arrancando.
Volumen persistente
Tu disco /workspace. Sobrevive a suspensiones y al borrado del Sandbox. Lo reutilizas en un Sandbox nuevo cuando quieras.
Auto-suspensión
Tras 30 min sin actividad el Sandbox se duerme y deja de cobrar compute. Vuelve en 5-8 s al reconectar. Puedes ponerla en manual.
Horas activas
El tiempo de reloj en el que el Sandbox está encendido. Es lo que pagas de compute. El disco se factura siempre.
2.4Crear un Sandbox, paso a paso
1Identidad
Ponle nombre a tu Sandbox y elige la imagen base (el sistema sobre el que arrancas).
2Volumen persistente
Crea uno nuevo o reutiliza uno libre. Elige el disco (10–500 GB). Si lo dejas sin etiqueta, lo llamamos workspace-1, -2…
3Plan y recursos
Elige tu plan (Starter, Pro o Team): cada uno fija vCPU, RAM y disco. La potencia de IA llega de Token Factory, sin GPU en el propio Sandbox.
4Auto-suspensión
Define el tiempo de inactividad antes de dormir el Sandbox, o elige «manual» para procesos largos que no quieres cortar.
5Asistentes de código
Opcional: Claude Code (con tu cuenta de Anthropic o con tokens GLM 5.2 FP8) y/o Open Code. Uno, ambos o ninguno.
6Clave SSH y resumen
Pegas tu clave pública SSH, revisas el resumen de costes y confirmas. El Sandbox se aprovisiona en segundos.
2.5Conectarte por SSH
SSH es el método estándar para entrar de forma segura a un ordenador remoto. En lugar de usuario y contraseña, usa un par de claves: dos archivos que solo funcionan juntos. Entender esta pareja es lo único «nuevo» que necesitas:
se comparte
Clave pública
id_ed25519.pub
Es como una cerradura: la pegas en el panel de GPU Flow. Puede verla cualquiera, no abre nada por sí sola.
jamás se comparte
Clave privada
id_ed25519
Es tu llave física: se queda en tu equipo. Si alguien la consigue, puede suplantarte. No la subas a ningún sitio.
Paso 1: genera tu clave (si aún no tienes). El archivo sin .pub es tu clave privada: nunca la compartas. Solo pegas la .pub en el panel.
Windows · PowerShell
# 1 · crea la carpeta de claves
New-Item -ItemType Directory -Force -Path "$HOME\.ssh" | Out-Null
# 2 · genera tu clave (Enter para sin contraseña)
ssh-keygen -t ed25519 -C "gpuflow"
# 3 · copia y pega esto para obtener tu clave y consultarla luego
Get-Content "$HOME\.ssh\id_ed25519.pub"
macOS · Linux
# 1 · crea la carpeta de claves
mkdir -p ~/.ssh && chmod 700 ~/.ssh
# 2 · genera tu clave (Enter para sin contraseña)
ssh-keygen -t ed25519 -C "gpuflow"
# 3 · copia y pega esto para obtener tu clave y consultarla luego
cat ~/.ssh/id_ed25519.pub
Pega la línea que empieza por ssh-ed25519 en el campo de clave pública del asistente.
Paso 2: conéctate. Pasas por nuestro bastion público, sin VPN. El bastion comprueba la huella de tu clave y te lleva a tu Sandbox.
tu equipo
cliente SSH + clave privada
bastion
ssh.gpuflow.ai verifica tu huella
tu Sandbox
devpod-<nombre> compute + /workspace
bash · ssh
# conéctate por el bastion (sin VPN) · cambia <tu-entorno> por el nombre de tu Sandbox
ssh -J ssh.gpuflow.ai developer@devpod-<tu-entorno>
Verifica la huella. La primera vez, tu cliente SSH te mostrará la huella del host. Compárala con la que aparece en la ficha del Sandbox en tu panel antes de aceptar. Encontrarás el comando exacto, con tu nombre de Sandbox ya rellenado, en esa misma ficha.
2.6Ciclo de vida del volumen persistente
Esto es lo que más sorprende y lo más útil: borrar el Sandbox no borra tus datos. El volumen sobrevive y lo reutilizas cuando quieras.
01
Crear
Al crear el Sandbox se crea su volumen.
02
Trabajar
Tus archivos viven en /workspace.
03
Pausar
El disco sobrevive intacto; compute deja de cobrar.
04
Borrar Sandbox
El Sandbox se va; el volumen queda libre y reutilizable.
05
Reutilizar / borrar
Lo enganchas a un Sandbox nuevo, o lo borras tú aparte.
El volumen se factura mientras exista, aunque ningún Sandbox lo use. Cuando ya no necesites los datos, bórralo desde la sección Volúmenes persistentes del panel para dejar de pagar por él.
2.7Cómo se factura
Tres reglas sencillas, y siempre verás el coste estimado antes de confirmar:
Compute
Solo por horas activas. Al suspender, deja de cobrar.
Disco
Se factura siempre, esté el Sandbox activo o pausado.
Tokens IA
Si usas asistentes con nuestros tokens, según consumo real.
3
Capítulo 3 · GPU dedicada
Una B200 reservada solo para ti.
La GPU dedicada es una NVIDIA B200 (completa o en fracciones MIG) reservada en exclusiva para tu carga, con rendimiento estable y aislamiento por hardware. A diferencia del Sandbox, no se comparte ni se reasigna: es tuya mientras la tengas reservada. Hoy se aprovisiona de forma manual — eliges la configuración y te contactamos para montarla.
En pocas palabras
Una GPU NVIDIA B200 reservada solo para ti, aislada por hardware, para cargas continuas que necesitan capacidad garantizada. Eliges la configuración en la web y te contactamos para aprovisionarla.
3.1¿Qué es una GPU dedicada?
Es una GPU reservada en exclusiva para tu proyecto, frente al Sandbox donde el acelerador se asigna bajo demanda. Te interesa cuando tienes una carga continua (entrenamiento largo, inferencia en producción) y quieres rendimiento estable y predecible.
3.2Configuraciones
Ofrecemos la B200 completa (180 GB) y fracciones MIG (porciones de una B200 aisladas entre sí) para cargas más pequeñas. Las configuraciones y precios exactos están en la página de precios; el detalle del producto, en la página de GPU dedicada.
3.3Cómo solicitarla
En el configurador de GPU dedicada eliges el modelo de GPU; el resto de opciones quedan fijadas por ahora. Al enviar, te pedimos tus datos y te contactamos para reservar y montar tu nodo. Una vez activa, te conectas por SSH igual que en un Sandbox (mismo bastión, misma clave pública).
3.4Cómo se factura
Al ser capacidad reservada, el precio es a medida según la configuración y el periodo de reserva — te lo confirmamos en el contacto. Las tarifas de referencia (B200 completa y fracciones MIG, por hora o reservada) están en la página de precios.
3
Capítulo 3 · Glosario
Las palabras clave, en lenguaje sencillo.
Si te has topado con un término y no estabas seguro de qué significaba, aquí lo tienes explicado sin tecnicismos.
3.1Conceptos generales
GPU
Tarjeta gráfica. Un chip diseñado para hacer muchísimos cálculos a la vez; es lo que hace que la IA vaya rápida.
Inferencia
El momento en que un modelo ya entrenado responde a una pregunta. Lo contrario de «entrenar».
LLM
«Large Language Model»: un modelo de IA que entiende y genera texto (como el que hay detrás de un chat).
Token
El trozo mínimo de texto que cuenta el modelo. Una palabra corta ≈ 1 token. Es la unidad con la que se mide el precio.
API
La «puerta» por la que un programa habla con otro a través de internet.
SDK
Un kit de herramientas (librería) para tu lenguaje de programación que facilita usar una API.
Streaming
Recibir la respuesta poco a poco, palabra a palabra, en vez de esperar a que esté completa.
base_url
La dirección a la que tu código envía las peticiones. Cambiarla es lo único necesario para usar GPU Flow.
3.2Sandboxes e infraestructura
SSH
Forma segura de conectarte y dar órdenes a un ordenador remoto desde el tuyo.
Clave pública / privada
La pareja de archivos de SSH: la pública es la cerradura (se comparte), la privada es la llave (nunca se comparte).
Bastion
Servidor intermedio seguro por el que pasas para llegar a tu Sandbox, sin necesidad de VPN.
Volumen persistente
El disco (/workspace) donde se guardan tus archivos. Sobrevive aunque borres el Sandbox.
Auto-suspensión
Que el Sandbox se duerma solo tras un rato de inactividad para dejar de cobrarte compute.
vCPU / RAM / vRAM
Procesador, memoria del sistema y memoria de la tarjeta gráfica, respectivamente.
RGPD / GDPR
El reglamento europeo de protección de datos. GPU Flow lo cumple manteniendo todo en la UE.