desarrolladores

Construye sobre GPUFlow.

Una API compatible con tu SDK, un acceso por SSH a tu máquina y una GPU entera si la necesitas. Todo lo que hace falta para conectar cada producto, ordenado por producto.

base_url https://api.gpuflow.ai/v1

empezar

Del alta a la primera respuesta

  1. 1Crea tu clave en el panelTe das de alta con 50 € de saldo, entras en API keys y creas una. Se muestra una sola vez, así que cópiala en ese momento.
  2. 2Apunta tu SDKCambia la URL base a https://api.gpuflow.ai/v1 y usa tu clave. El resto de tu código no se toca.
  3. 3Llama a un modeloCualquiera de los 15 del catálogo: los de texto con el SDK de OpenAI o el de Anthropic, y los de audio y música por sus propios endpoints.

Al crearla eliges si vale para todas las APIs o solo para Token Factory.

token factory

La API de inferencia

Compatible con los SDK de OpenAI y Anthropic. Cambias la URL base, pegas tu clave y el resto de tu código no se toca.

URL base

https://api.gpuflow.ai

Autenticación

Authorization: Bearer $GPUFLOW_API_KEY

Incluye tu API key en la cabecera Authorization como Bearer token. Puedes crear y gestionar tus keys desde el dashboard.

Endpoints

POST
/v1/chat/completions
Endpoint principal compatible con el SDK de OpenAI. Soporta streaming, function calling y los modelos del catálogo.
POST
/v1/messages
Endpoint compatible con el SDK de Anthropic. Misma funcionalidad, formato de mensajes Anthropic.
GET
/v1/models
Lista los modelos disponibles con sus precios y capacidades.
POST
/v1/audio/transcriptions
Sube un archivo de audio y recibes el texto. Multipart; con response_format=verbose_json te devuelve también la duración, que es lo que se factura.
POST
/v1/audio/speech
Envías texto y una voz, y recibes el audio. Se factura por caracteres.
POST
/v1/music/generations
Genera una canción entera. Es asíncrono: devuelve un identificador, consultas el estado y descargas la pista cuando termina.

Streaming y razonamiento

Streaming (SSE)

Añade "stream": true y recibes la respuesta por Server-Sent Events, token a token. Inyectamos keep-alives para que las conexiones largas no se corten en proxies intermedios.

Razonamiento configurable

Los modelos que razonan aceptan un presupuesto de pensamiento: contrólalo con reasoning.effort ("low", "medium", "high" o "none" para desactivarlo) o con reasoning.max_tokens. Funciona desde el SDK de OpenAI y desde el de Anthropic (thinking.budget_tokens), lo traducimos al motor por ti.

petición

{ "model": "glm-5.3-nvfp4",
  "messages": [{ "role": "user", "content": "Resuélvelo paso a paso" }],
  "stream": true,
  "reasoning": { "effort": "high" } }

Function calling

5 de los 9 modelos de texto soportan herramientas, con el formato estándar de OpenAI. Pasas tu array de tools y el modelo decide cuándo invocarlas; tú ejecutas la función y devuelves el resultado. En el catálogo de abajo llevan la capacidad «Herramientas».

petición

{ "model": "glm-5.3-nvfp4",
  "messages": [{ "role": "user", "content": "¿Qué tiempo hace hoy?" }],
  "tools": [{
    "type": "function",
    "function": {
      "name": "get_weather",
      "parameters": {
        "type": "object",
        "properties": { "city": { "type": "string" } }
      }
    }
  }] }

Tu primera llamada, en tu lenguaje

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.gpuflow.ai/v1",
    api_key=os.environ["GPUFLOW_API_KEY"]
)

response = client.chat.completions.create(
    model="glm-5.3-nvfp4",
    messages=[{"role": "user", "content": "Hello!"}],
    max_tokens=10000
)

print(response.choices[0].message.content)

Códigos de error

401
API key inválida o no proporcionada
402
Saldo insuficiente, recarga desde el dashboard
403
No tienes permiso para usar este modelo
404
Modelo no encontrado
429
Rate limit excedido, espera e intentalo de nuevo (cabecera Retry-After)
503
Modelo saturado temporalmente, reintenta con backoff (cabecera Retry-After)

Ver la referencia completa de la API

sandboxes

Tu máquina por SSH

Un contenedor con acceso SSH, disco propio y los agentes de código ya instalados. Se conecta a través de nuestro bastión: sin VPN y sin túneles.

1. Genera tu llave

Tres comandos y la tienes. No le pongas ruta con -f: OpenSSH busca ~/.ssh/id_ed25519 por su cuenta al saltar por el bastión, y una llave en otro sitio es la causa habitual de que el acceso falle.

# 1. crea la carpeta de claves
mkdir -p ~/.ssh && chmod 700 ~/.ssh

# 2. genera tu clave (Enter para dejarla sin contraseña)
ssh-keygen -t ed25519 -C "gpuflow"

# 3. muéstrala para copiarla
cat ~/.ssh/id_ed25519.pub

Pega la clave PÚBLICA, la que acaba en .pub. La privada no sale nunca de tu máquina.

2. Conecta

Un solo comando, sin abrir túneles ni segundas terminales. El -J salta por el bastión, que te identifica con la misma llave que registraste y te lleva a tu Sandbox.

terminal

ssh -J [email protected] developer@mi-sandbox

3. Lo que el bastión no deja pasar

Solo el túnel hasta tu Sandbox: nada de reenvío de agente, X11, variables de entorno ni redirección de puertos desde el bastión. Y si el Sandbox está en pausa o borrado te rechaza con un mensaje, en vez de dejarte esperando a una máquina que no está.

El disco sobrevive al Sandbox

Tus archivos viven en un disco de red aparte. Pausar el Sandbox no lo toca, y borrarlo tampoco: el disco sigue ahí y puedes engancharlo a uno nuevo.

La API desde dentro

Desde el Sandbox, Token Factory se llama por la red interna. La clave no sale del perímetro y no viaja por internet.

Agentes ya instalados

Claude Code y OpenCode vienen montados y apuntando a la API. Abres la terminal y ya trabajan contra tus modelos.

gpu dedicada

Lo mismo, con una GPU para ti

Una GPU dedicada es un Sandbox con una tarjeta en exclusiva: mismo SSH, mismo disco, mismos agentes. Lo que cambia es lo de debajo.

No cambia nada de tu lado

La conexión, el disco y los agentes funcionan igual que en cualquier Sandbox. Lo que aprendas arriba te vale aquí.

La tarjeta es tuya, también en pausa

Sin vecinos y sin colas: la memoria de vídeo no se comparte, así que un modelo cargado no compite con nadie.

Se activa hablando

No se aprovisiona sola. Eliges la configuración, nos escribes y confirmamos contigo la disponibilidad y las specs antes de encenderla.

cli y agentes

Fuera del navegador

Una CLI para los tres productos y un servidor MCP para que tus agentes los usen solos. Las dos se instalan desde npm y cada una tiene su guía.

CLI

Un único binario para inferencia, cuenta, Sandboxes, GPU y discos: listar modelos, hablar con uno, ver tu saldo y tu consumo, crear y pausar Sandboxes, consultar la disponibilidad de GPU.

leer la guía de la CLI

Servidor MCP

Veinte herramientas para que Claude, Cursor o tu propio agente hablen con GPU Flow: el catálogo y el chat, y en solo lectura tu saldo, tus Sandboxes y la capacidad libre de GPU. Lo que crea, pausa o borra va detrás de un permiso que hay que encender a mano.

leer la guía del MCP

Tu primera llamada, hoy.

Cuenta en un minuto y 50 € de saldo al activar tu tarjeta.