atrás

desarrolladores

Construye sobre GPUFlow.

Una API compatible con tu SDK, una CLI para los tres servicios y un servidor MCP para que tus agentes la usen solos. Empieza en segundos; la referencia completa, abajo.

Quickstart

Del signup al primer token, sin reescribir tu código.

  1. 01

    Consigue tu API key

    Crea tu cuenta y recibes 5 € de saldo. La key te llega por email.

  2. 02

    Apunta tu SDK

    Cambia la URL base a https://api.gpuflow.ai/v1 y pega tu key. El resto de tu código no se toca.

  3. 03

    Primer curl

    Llama a cualquiera de los 16 modelos del catálogo con el SDK de OpenAI o Anthropic.

curl https://api.gpuflow.ai/v1/chat/completions \
  -H "Authorization: Bearer $GPUFLOW_API_KEY" \
  -d '{ "model": "deepseek-v4-flash",
        "messages": [{ "role": "user", "content": "Hola" }] }'

La API de GPUFlow desde tu terminal

Una sola herramienta para tu inferencia. Los comandos models y chat ya funcionan contra la API; la gestión de cuenta, sandboxes y GPU llegan a la misma CLI.

instalar
$ npm i -g @gpuflow/cli

# configura tu API key

$ gpuflow config set api-key gpf-...

# lista el catálogo de modelos (en vivo)

$ gpuflow models

# habla con un modelo (streaming)

$ gpuflow chat "Explícame RDMA en una frase"

Infraestructura para agentes

GPUFlow es agent-native: tus agentes la usan por MCP, por su SDK, o desde un Sandbox con el agente ya instalado.

Servidor MCP

Conecta GPUFlow a Claude, Cursor o tu agente: lista modelos y chatea con ellos como herramientas MCP. Más herramientas pronto.

npx @gpuflow/mcp

Plantillas de agente

Los Sandbox arrancan con Claude Code, OpenCode, OpenClaw o Hermes ya instalados y conectados a la API por red interna.

Compatibles con tu SDK

Cualquier agente que use el SDK de OpenAI o Anthropic funciona apuntando a GPUFlow, sin capa de traducción.

Referencia de la API

URL base

https://api.gpuflow.ai

Autenticación

Incluye tu API key en la cabecera Authorization como Bearer token. Puedes crear y gestionar tus keys desde el dashboard.

Authorization: Bearer gpf-...

Endpoints

POST /v1/chat/completions

Endpoint principal compatible con el SDK de OpenAI. Soporta streaming, function calling y los modelos del catálogo.

POST /v1/messages

Endpoint compatible con el SDK de Anthropic. Misma funcionalidad, formato de mensajes Anthropic.

GET /v1/models

Lista los modelos disponibles con sus precios y capacidades.

Streaming y razonamiento

Streaming (SSE)

Añade "stream": true y recibes la respuesta por Server-Sent Events, token a token. Inyectamos keep-alives para que las conexiones largas no se corten en proxies intermedios.

Razonamiento configurable

Los modelos del catálogo razonan. Controla el presupuesto de pensamiento con reasoning.effort ("low", "medium", "high" o "none" para desactivarlo) o con reasoning.max_tokens. Funciona desde el SDK de OpenAI y de Anthropic (thinking.budget_tokens), lo traducimos al motor por ti.

{ "model": "deepseek-v4-pro",
  "messages": [{ "role": "user", "content": "Resuélvelo paso a paso" }],
  "stream": true,
  "reasoning": { "effort": "high" } }

Function calling

Los 10 modelos soportan herramientas (tool calling) con el formato estándar de OpenAI. Pasa tu array de tools y el modelo decide cuándo invocarlas; tú ejecutas la función y devuelves el resultado.

{ "model": "qwen-3.8-27b",
  "messages": [{ "role": "user", "content": "¿Qué tiempo hace en Madrid?" }],
  "tools": [{
    "type": "function",
    "function": {
      "name": "get_weather",
      "parameters": {
        "type": "object",
        "properties": { "city": { "type": "string" } }
      }
    }
  }] }

Python (OpenAI SDK)

from openai import OpenAI

client = OpenAI(
    base_url="https://api.gpuflow.ai/v1",
    api_key="gpf-..."
)

response = client.chat.completions.create(
    model="qwen-3.5-9b",
    messages=[{"role": "user", "content": "Hello!"}],
    max_tokens=10000
)

print(response.choices[0].message.content)

Node.js (Anthropic SDK)

import Anthropic from "@anthropic-ai/sdk";

const client = new Anthropic({
  baseURL: "https://api.gpuflow.ai",
  apiKey: "gpf-..."
});

const msg = await client.messages.create({
  model: "qwen-3.5-9b",
  max_tokens: 10000,
  messages: [{ role: "user", content: "Hello!" }]
});

console.log(msg.content[0].text);

curl

curl https://api.gpuflow.ai/v1/chat/completions \
  -H "Authorization: Bearer gpf-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-3.5-9b",
    "messages": [{"role": "user", "content": "Hello!"}],
    "max_tokens": 10000
  }'

Catálogo de modelos

Todos los modelos corren en nuestra infraestructura en España. Precios por millón de tokens.

modeloentrada EUR/Msalida EUR/Mcapacidades
deepseek-v4-prodestacado0,802,60Chat, Código, Razonamiento, Herramientas
glm-5.2-nvfp4destacado1,003,00Chat, Código, Razonamiento, Herramientas, Contexto largo
deepseek-v4-flash0,140,28Chat, Razonamiento, Herramientas
qwen-3.8-27b0,100,30Razonamiento, json_mode
qwen-3-14b0,201,00Chat, Razonamiento, Herramientas
qwen-3.5-9b0,100,15Chat, Razonamiento, Herramientas
gemma-4-26b-a4b0,120,30Razonamiento, Herramientas
nemotron-nano-12b-v2-vl0,060,24image-text-to-text, OCR
qwen3-vl-32b-ocr0,100,35image-text-to-text, OCR
nemotron-3.5-lightning-30b-a3b0,120,30Razonamiento, Herramientas

Códigos de error

401API key inválida o no proporcionada
402Saldo insuficiente, recarga desde el dashboard
403No tienes permiso para usar este modelo
404Modelo no encontrado
429Rate limit excedido, espera e intentalo de nuevo (cabecera Retry-After)
503Modelo saturado temporalmente, reintenta con backoff (cabecera Retry-After)