desarrolladores
Construye sobre GPUFlow.
Una API compatible con tu SDK, un acceso por SSH a tu máquina y una GPU entera si la necesitas. Todo lo que hace falta para conectar cada producto, ordenado por producto.
base_url https://api.gpuflow.ai/v1
Del alta a la primera respuesta
- 1Crea tu clave en el panelTe das de alta con 50 € de saldo, entras en API keys y creas una. Se muestra una sola vez, así que cópiala en ese momento.
- 2Apunta tu SDKCambia la URL base a https://api.gpuflow.ai/v1 y usa tu clave. El resto de tu código no se toca.
- 3Llama a un modeloCualquiera de los 15 del catálogo: los de texto con el SDK de OpenAI o el de Anthropic, y los de audio y música por sus propios endpoints.
Al crearla eliges si vale para todas las APIs o solo para Token Factory.
La API de inferencia
Compatible con los SDK de OpenAI y Anthropic. Cambias la URL base, pegas tu clave y el resto de tu código no se toca.
URL base
https://api.gpuflow.ai
Autenticación
Authorization: Bearer $GPUFLOW_API_KEY
Incluye tu API key en la cabecera Authorization como Bearer token. Puedes crear y gestionar tus keys desde el dashboard.
Endpoints
- /v1/chat/completions
- Endpoint principal compatible con el SDK de OpenAI. Soporta streaming, function calling y los modelos del catálogo.
- /v1/messages
- Endpoint compatible con el SDK de Anthropic. Misma funcionalidad, formato de mensajes Anthropic.
- /v1/models
- Lista los modelos disponibles con sus precios y capacidades.
- /v1/audio/transcriptions
- Sube un archivo de audio y recibes el texto. Multipart; con response_format=verbose_json te devuelve también la duración, que es lo que se factura.
- /v1/audio/speech
- Envías texto y una voz, y recibes el audio. Se factura por caracteres.
- /v1/music/generations
- Genera una canción entera. Es asíncrono: devuelve un identificador, consultas el estado y descargas la pista cuando termina.
Streaming y razonamiento
Streaming (SSE)
Añade "stream": true y recibes la respuesta por Server-Sent Events, token a token. Inyectamos keep-alives para que las conexiones largas no se corten en proxies intermedios.
Razonamiento configurable
Los modelos que razonan aceptan un presupuesto de pensamiento: contrólalo con reasoning.effort ("low", "medium", "high" o "none" para desactivarlo) o con reasoning.max_tokens. Funciona desde el SDK de OpenAI y desde el de Anthropic (thinking.budget_tokens), lo traducimos al motor por ti.
petición
{ "model": "glm-5.3-nvfp4",
"messages": [{ "role": "user", "content": "Resuélvelo paso a paso" }],
"stream": true,
"reasoning": { "effort": "high" } }Function calling
5 de los 9 modelos de texto soportan herramientas, con el formato estándar de OpenAI. Pasas tu array de tools y el modelo decide cuándo invocarlas; tú ejecutas la función y devuelves el resultado. En el catálogo de abajo llevan la capacidad «Herramientas».
petición
{ "model": "glm-5.3-nvfp4",
"messages": [{ "role": "user", "content": "¿Qué tiempo hace hoy?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } }
}
}
}] }Tu primera llamada, en tu lenguaje
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.gpuflow.ai/v1",
api_key=os.environ["GPUFLOW_API_KEY"]
)
response = client.chat.completions.create(
model="glm-5.3-nvfp4",
messages=[{"role": "user", "content": "Hello!"}],
max_tokens=10000
)
print(response.choices[0].message.content)Códigos de error
- 401
- API key inválida o no proporcionada
- 402
- Saldo insuficiente, recarga desde el dashboard
- 403
- No tienes permiso para usar este modelo
- 404
- Modelo no encontrado
- 429
- Rate limit excedido, espera e intentalo de nuevo (cabecera Retry-After)
- 503
- Modelo saturado temporalmente, reintenta con backoff (cabecera Retry-After)
Catálogo de modelos
Todos los modelos corren en nuestra infraestructura en España. Precios por millón de tokens.
| modelo | entrada EUR/M | salida EUR/M | capacidades |
|---|---|---|---|
| glm-5.3-nvfp4 | 1,206 € | 3,789 € | Chat, Código, Razonamiento, Herramientas |
| qwen-3.8-27b | 0,10 € | 0,30 € | Razonamiento, Respuesta en JSON |
| qwen-3-14b | 0,20 € | 1,00 € | Chat, Razonamiento, Herramientas |
| qwen-3.5-9b | 0,10 € | 0,15 € | Chat, Razonamiento, Herramientas |
| alia-40b-instruct | 0,20 € | 2,00 € | Chat |
| gemma-4-26b-a4b | 0,12 € | 0,30 € | Razonamiento, Herramientas |
| nemotron-nano-12b-v2-vl | 0,06 € | 0,24 € | Visión, OCR |
| qwen3-vl-32b-ocr | 0,10 € | 0,35 € | Visión, OCR |
| nemotron-3.5-lightning-30b-a3b | 0,12 € | 0,30 € | Razonamiento, Herramientas |
| whisper-large-v3 | 0,0015 € por minuto de audio | Transcripción | |
| qwen3-tts-customvoice | 19,00 € por millón de caracteres | TTS, Clonación de voz | |
| qwen3-tts-base | 5,00 € por millón de caracteres | TTS | |
| fish-speech-s2-pro | 8,00 € por millón de caracteres | TTS, Clonación de voz | |
| voxtral-tts | 6,00 € por millón de caracteres | TTS | |
| acestep-musicdestacado | 0,50 € por canción | Texto a música, Versiones, Rehacer partes, Separar pistas, Editar la canción | |
Los de voz se facturan por minuto o por caracteres, y la música por canción. El detalle de cada uno está en su ficha. Catálogo de modelos.
Precios en EUR por millón de tokens, IVA incluido.
Tu máquina por SSH
Un contenedor con acceso SSH, disco propio y los agentes de código ya instalados. Se conecta a través de nuestro bastión: sin VPN y sin túneles.
1. Genera tu llave
Tres comandos y la tienes. No le pongas ruta con -f: OpenSSH busca ~/.ssh/id_ed25519 por su cuenta al saltar por el bastión, y una llave en otro sitio es la causa habitual de que el acceso falle.
# 1. crea la carpeta de claves mkdir -p ~/.ssh && chmod 700 ~/.ssh # 2. genera tu clave (Enter para dejarla sin contraseña) ssh-keygen -t ed25519 -C "gpuflow" # 3. muéstrala para copiarla cat ~/.ssh/id_ed25519.pub
Pega la clave PÚBLICA, la que acaba en .pub. La privada no sale nunca de tu máquina.
2. Conecta
Un solo comando, sin abrir túneles ni segundas terminales. El -J salta por el bastión, que te identifica con la misma llave que registraste y te lleva a tu Sandbox.
terminal
ssh -J [email protected] developer@mi-sandbox
3. Lo que el bastión no deja pasar
Solo el túnel hasta tu Sandbox: nada de reenvío de agente, X11, variables de entorno ni redirección de puertos desde el bastión. Y si el Sandbox está en pausa o borrado te rechaza con un mensaje, en vez de dejarte esperando a una máquina que no está.
El disco sobrevive al Sandbox
Tus archivos viven en un disco de red aparte. Pausar el Sandbox no lo toca, y borrarlo tampoco: el disco sigue ahí y puedes engancharlo a uno nuevo.
La API desde dentro
Desde el Sandbox, Token Factory se llama por la red interna. La clave no sale del perímetro y no viaja por internet.
Agentes ya instalados
Claude Code y OpenCode vienen montados y apuntando a la API. Abres la terminal y ya trabajan contra tus modelos.
Lo mismo, con una GPU para ti
Una GPU dedicada es un Sandbox con una tarjeta en exclusiva: mismo SSH, mismo disco, mismos agentes. Lo que cambia es lo de debajo.
No cambia nada de tu lado
La conexión, el disco y los agentes funcionan igual que en cualquier Sandbox. Lo que aprendas arriba te vale aquí.
La tarjeta es tuya, también en pausa
Sin vecinos y sin colas: la memoria de vídeo no se comparte, así que un modelo cargado no compite con nadie.
Se activa hablando
No se aprovisiona sola. Eliges la configuración, nos escribes y confirmamos contigo la disponibilidad y las specs antes de encenderla.
Fuera del navegador
Una CLI para los tres productos y un servidor MCP para que tus agentes los usen solos. Las dos se instalan desde npm y cada una tiene su guía.
CLI
Un único binario para inferencia, cuenta, Sandboxes, GPU y discos: listar modelos, hablar con uno, ver tu saldo y tu consumo, crear y pausar Sandboxes, consultar la disponibilidad de GPU.
leer la guía de la CLIServidor MCP
Veinte herramientas para que Claude, Cursor o tu propio agente hablen con GPU Flow: el catálogo y el chat, y en solo lectura tu saldo, tus Sandboxes y la capacidad libre de GPU. Lo que crea, pausa o borra va detrás de un permiso que hay que encender a mano.
leer la guía del MCPTu primera llamada, hoy.
Cuenta en un minuto y 50 € de saldo al activar tu tarjeta.