referencia
Documentación de la API
La referencia completa de la API de inferencia: qué endpoints hay, cómo se autentica, qué devuelve cada uno y qué cuesta. Es el mismo contenido que verás dentro de la guía de Desarrolladores, aquí como documento aparte.
base_url https://api.gpuflow.ai/v1
URL base
https://api.gpuflow.ai
Autenticación
Authorization: Bearer $GPUFLOW_API_KEY
Incluye tu API key en la cabecera Authorization como Bearer token. Puedes crear y gestionar tus keys desde el dashboard.
Endpoints
- /v1/chat/completions
- Endpoint principal compatible con el SDK de OpenAI. Soporta streaming, function calling y los modelos del catálogo.
- /v1/messages
- Endpoint compatible con el SDK de Anthropic. Misma funcionalidad, formato de mensajes Anthropic.
- /v1/models
- Lista los modelos disponibles con sus precios y capacidades.
- /v1/audio/transcriptions
- Sube un archivo de audio y recibes el texto. Multipart; con response_format=verbose_json te devuelve también la duración, que es lo que se factura.
- /v1/audio/speech
- Envías texto y una voz, y recibes el audio. Se factura por caracteres.
- /v1/music/generations
- Genera una canción entera. Es asíncrono: devuelve un identificador, consultas el estado y descargas la pista cuando termina.
Streaming y razonamiento
Streaming (SSE)
Añade "stream": true y recibes la respuesta por Server-Sent Events, token a token. Inyectamos keep-alives para que las conexiones largas no se corten en proxies intermedios.
Razonamiento configurable
Los modelos que razonan aceptan un presupuesto de pensamiento: contrólalo con reasoning.effort ("low", "medium", "high" o "none" para desactivarlo) o con reasoning.max_tokens. Funciona desde el SDK de OpenAI y desde el de Anthropic (thinking.budget_tokens), lo traducimos al motor por ti.
petición
{ "model": "deepseek-v4-pro",
"messages": [{ "role": "user", "content": "Resuélvelo paso a paso" }],
"stream": true,
"reasoning": { "effort": "high" } }Function calling
7 de los 10 modelos de texto soportan herramientas, con el formato estándar de OpenAI. Pasas tu array de tools y el modelo decide cuándo invocarlas; tú ejecutas la función y devuelves el resultado. En el catálogo de abajo llevan la capacidad «Herramientas».
petición
{ "model": "deepseek-v4-pro",
"messages": [{ "role": "user", "content": "¿Qué tiempo hace hoy?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } }
}
}
}] }Tu primera llamada, en tu lenguaje
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.gpuflow.ai/v1",
api_key=os.environ["GPUFLOW_API_KEY"]
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Hello!"}],
max_tokens=10000
)
print(response.choices[0].message.content)Códigos de error
- 401
- API key inválida o no proporcionada
- 402
- Saldo insuficiente, recarga desde el dashboard
- 403
- No tienes permiso para usar este modelo
- 404
- Modelo no encontrado
- 429
- Rate limit excedido, espera e intentalo de nuevo (cabecera Retry-After)
- 503
- Modelo saturado temporalmente, reintenta con backoff (cabecera Retry-After)
Catálogo de modelos
Todos los modelos corren en nuestra infraestructura en España. Precios por millón de tokens.
| modelo | entrada EUR/M | salida EUR/M | capacidades |
|---|---|---|---|
| deepseek-v4-prodestacado | 0,80 € | 2,60 € | Chat, Código, Razonamiento, Herramientas |
| glm-5.2-nvfp4destacado | 1,00 € | 3,00 € | Chat, Código, Razonamiento, Herramientas, Contexto largo |
| deepseek-v4-flash | 0,14 € | 0,28 € | Chat, Razonamiento, Herramientas |
| qwen-3.8-27b | 0,10 € | 0,30 € | Razonamiento, Respuesta en JSON |
| qwen-3-14b | 0,20 € | 1,00 € | Chat, Razonamiento, Herramientas |
| qwen-3.5-9b | 0,10 € | 0,15 € | Chat, Razonamiento, Herramientas |
| gemma-4-26b-a4b | 0,12 € | 0,30 € | Razonamiento, Herramientas |
| nemotron-nano-12b-v2-vl | 0,06 € | 0,24 € | Visión, OCR |
| qwen3-vl-32b-ocr | 0,10 € | 0,35 € | Visión, OCR |
| nemotron-3.5-lightning-30b-a3b | 0,12 € | 0,30 € | Razonamiento, Herramientas |
| whisper-large-v3 | 0,0015 € por minuto de audio | Transcripción | |
| qwen3-tts-customvoice | 19,00 € por millón de caracteres | TTS, Clonación de voz | |
| qwen3-tts-base | 5,00 € por millón de caracteres | TTS | |
| fish-speech-s2-pro | 8,00 € por millón de caracteres | TTS, Clonación de voz | |
| voxtral-tts | 6,00 € por millón de caracteres | TTS | |
| acestep-musicdestacado | 0,50 € por canción | Texto a música, Versiones, Rehacer partes, Separar pistas, Editar la canción | |
Los de voz se facturan por minuto o por caracteres, y la música por canción. El detalle de cada uno está en su ficha. Catálogo de modelos.
Precios en EUR por millón de tokens, IVA incluido.
Tu primera llamada, hoy.
Cuenta en un minuto, sin tarjeta, con 50 € de saldo ya cargados.