token factory · api llm

Cambia una línea. Tu inferencia, en Europa.

Apunta el SDK de OpenAI o Anthropic a GPUFlow y tu código sigue igual: 15 modelos open source servidos en GPU NVIDIA B200, en España, con saldo en euros.

cómo empezar

Del registro al primer token en menos de 30 segundos.

  1. 01

    Eliges tu saldo

    Empieza gratis con 5 € al crear tu cuenta, o elige un bundle (10 / 50 / 200 / 1000 €) con bonus. El saldo no caduca.

  2. 02

    Validas el pago

    En la prueba gratis solo confirmas tu cuenta. Si eliges bundle, pagas en la pasarela segura de Stripe, en euros.

  3. 03

    Recibes tu API key

    Te llega por email junto al acceso al panel de administración. Apuntas tu SDK a GPUFlow y haces el primer curl.

compatibilidad

No reescribes nada. Cambias una línea.

Token Factory habla el protocolo de OpenAI (/v1/chat/completions) y el de Anthropic (/v1/messages). Si ya usas cualquiera de los dos SDK, solo cambias el endpoint.

  • Endpoints /v1/chat/completions y /v1/messages
  • Streaming, function calling y razonamiento configurable (reasoning.effort)
  • Mismos formatos de petición y respuesta, sin capa de traducción

endpoints

OpenAIPOST /v1/chat/completions
AnthropicPOST /v1/messages

base url · https://api.gpuflow.ai

catálogo

15 modelos open source, desplegados y listos.

DeepSeek, GLM, Qwen y Gemma, servidos en nuestra infraestructura. Precio por millón de tokens, con desglose entrada/salida. Si necesitas otro y entra en la GPU, lo desplegamos.

modeloentrada · €/Mtoksalida · €/Mtokficha
DeepSeek V4 Pro

1,6T MoE en 8× B200. Razonamiento de máxima potencia.

ChatCódigoRazonamientoHerramientas
0,802,60ficha
GLM 5.2 NVFP4

743B NVFP4 en 8× B200. Generalista y coding con tool calling.

ChatCódigoRazonamientoHerramientasContexto largo
1,003,00ficha
DeepSeek V4 Flash

1,6T MoE en 2× B200. Alto throughput y contexto de 524K.

ChatRazonamientoHerramientas
0,140,28ficha
Qwen3.6 27B

27B denso. Fuerte en coding y agentes, con tool calling.

ChatRazonamientoHerramientasOCR
0,302,40ficha
Qwen3 14B

14B FP8. Razonamiento con presupuesto de pensamiento.

ChatRazonamientoHerramientas
0,201,00ficha
Qwen3.5 9B

9B ultraligero. Rápido y económico, con tool calling.

ChatRazonamientoHerramientas
0,100,15ficha
Gemma 4 26B A4B

MoE multimodal, ~3.8B activos. Visión, razonamiento y herramientas.

RazonamientoHerramientas
0,120,30ficha
Nemotron Nano 12B VL

Modelo visión-lenguaje para OCR y comprensión de documentos. Contexto 128K, hasta 4 imágenes por prompt.

image-text-to-textOCR
0,060,24ficha
Qwen3-VL 32B OCR

Modelo visión-lenguaje para OCR y comprensión de documentos. Contexto 64K, hasta 4 imágenes por prompt.

image-text-to-textOCR
0,100,35ficha
Nemotron 3.5 Lightning 30B

Híbrido MoE + Mamba-2, ~3B activos. Razonamiento y tool calling, contexto 128K.

RazonamientoHerramientas
0,120,30ficha

rendimiento

Por qué va rápido.

El tiempo hasta el primer token es lo que nota tu usuario. Lo cuidamos a nivel de hardware.

< 100 ms TTFT

El tiempo hasta el primer token, la métrica que de verdad nota el usuario (no los tokens/segundo de folleto). Lo bajamos con prefix caching y chunked prefill en el motor.

NVIDIA B200 dedicada

Aceleradores de última generación en bare metal. Sin tenant compartido que te robe latencia en hora punta.

Red interna RDMA

Baja latencia entre nodos. Si lo combinas con un Sandbox, las llamadas no salen a internet pública.

ver en acción

Una llamada, respuesta en streaming.

Compatible con los SDK de OpenAI y Anthropic: cambia la URL base, pega tu key y ya estás llamando a 15 modelos open source servidos en GPU B200.

from openai import OpenAI

client = OpenAI(base_url="https://api.gpuflow.ai/v1",
                api_key=os.environ["GPUFLOW_API_KEY"])

stream = client.chat.completions.create(
    model="qwen-3.5-9b",
    messages=[{"role": "user", "content": "¿Qué es GPUFlow? Respóndeme en una frase."}],
    stream=True,
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")
edita el prompt y pulsa Probar

respuesta

·NVIDIA B200

Demo en vivo con límite de uso · respuesta de un modelo pequeño. Para producción, abre tu cuenta.

precios

Prepago en euros. Sin sorpresas.

Cargas saldo, consumes por tokens, ves el gasto en el panel. Sin cuotas, sin mínimos, sin conversión de divisa.

ver precios completos

preguntas frecuentes

Lo que preguntan los devs antes de empezar.

¿Tengo que reescribir mi código?

No. Token Factory habla el protocolo de OpenAI (/v1/chat/completions) y el de Anthropic (/v1/messages). Apuntas el SDK que ya usas a https://api.gpuflow.ai, pegas tu key y el resto de tu código no se toca.

¿Qué modelos puedo llamar?

Los 15 del catálogo (DeepSeek, GLM, Qwen, Gemma, NVIDIA, OpenAI, Mistral y Fish Audio), todos con la misma API key. Si necesitas otro modelo open source y entra en la GPU, lo desplegamos.

¿Hay límites de uso?

Consumes contra tu saldo prepago: pagas por tokens hasta donde tengas cargado, sin cuotas ni mínimos. Si necesitas volumen alto sostenido, escríbenos y ajustamos los límites de tu cuenta.

¿Entrenáis con mis datos?

No. Tus prompts y respuestas se procesan para servir tu petición y no se usan para entrenar modelos. El detalle está en la política de privacidad.

¿Dónde se procesan mis datos?

En nuestro datacenter en España, sobre GPU NVIDIA B200 dedicada. Los datos no salen de Europa.

¿Ofrecéis SLA?

Publicamos la disponibilidad en la página de estado. Para un SLA contractual (cuentas enterprise), escríbenos y lo acordamos.

5 € gratis para tu primer curl.

Crea la cuenta y llama a cualquier modelo del catálogo. Sin tarjeta.