referencia

Documentación de la API

La referencia completa de la API de inferencia: qué endpoints hay, cómo se autentica, qué devuelve cada uno y qué cuesta. Es el mismo contenido que verás dentro de la guía de Desarrolladores, aquí como documento aparte.

base_url https://api.gpuflow.ai/v1

URL base

https://api.gpuflow.ai

Autenticación

Authorization: Bearer $GPUFLOW_API_KEY

Incluye tu API key en la cabecera Authorization como Bearer token. Puedes crear y gestionar tus keys desde el dashboard.

Endpoints

POST
/v1/chat/completions
Endpoint principal compatible con el SDK de OpenAI. Soporta streaming, function calling y los modelos del catálogo.
POST
/v1/messages
Endpoint compatible con el SDK de Anthropic. Misma funcionalidad, formato de mensajes Anthropic.
GET
/v1/models
Lista los modelos disponibles con sus precios y capacidades.
POST
/v1/audio/transcriptions
Sube un archivo de audio y recibes el texto. Multipart; con response_format=verbose_json te devuelve también la duración, que es lo que se factura.
POST
/v1/audio/speech
Envías texto y una voz, y recibes el audio. Se factura por caracteres.
POST
/v1/music/generations
Genera una canción entera. Es asíncrono: devuelve un identificador, consultas el estado y descargas la pista cuando termina.

Streaming y razonamiento

Streaming (SSE)

Añade "stream": true y recibes la respuesta por Server-Sent Events, token a token. Inyectamos keep-alives para que las conexiones largas no se corten en proxies intermedios.

Razonamiento configurable

Los modelos que razonan aceptan un presupuesto de pensamiento: contrólalo con reasoning.effort ("low", "medium", "high" o "none" para desactivarlo) o con reasoning.max_tokens. Funciona desde el SDK de OpenAI y desde el de Anthropic (thinking.budget_tokens), lo traducimos al motor por ti.

petición

{ "model": "deepseek-v4-pro",
  "messages": [{ "role": "user", "content": "Resuélvelo paso a paso" }],
  "stream": true,
  "reasoning": { "effort": "high" } }

Function calling

7 de los 10 modelos de texto soportan herramientas, con el formato estándar de OpenAI. Pasas tu array de tools y el modelo decide cuándo invocarlas; tú ejecutas la función y devuelves el resultado. En el catálogo de abajo llevan la capacidad «Herramientas».

petición

{ "model": "deepseek-v4-pro",
  "messages": [{ "role": "user", "content": "¿Qué tiempo hace hoy?" }],
  "tools": [{
    "type": "function",
    "function": {
      "name": "get_weather",
      "parameters": {
        "type": "object",
        "properties": { "city": { "type": "string" } }
      }
    }
  }] }

Tu primera llamada, en tu lenguaje

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.gpuflow.ai/v1",
    api_key=os.environ["GPUFLOW_API_KEY"]
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Hello!"}],
    max_tokens=10000
)

print(response.choices[0].message.content)

Códigos de error

401
API key inválida o no proporcionada
402
Saldo insuficiente, recarga desde el dashboard
403
No tienes permiso para usar este modelo
404
Modelo no encontrado
429
Rate limit excedido, espera e intentalo de nuevo (cabecera Retry-After)
503
Modelo saturado temporalmente, reintenta con backoff (cabecera Retry-After)

Tu primera llamada, hoy.

Cuenta en un minuto, sin tarjeta, con 50 € de saldo ya cargados.