< 100 ms TTFT
El tiempo hasta el primer token, la métrica que de verdad nota el usuario (no los tokens/segundo de folleto). Lo bajamos con prefix caching y chunked prefill en el motor.
token factory · api llm
Apunta el SDK de OpenAI o Anthropic a GPUFlow y tu código sigue igual: 15 modelos open source servidos en GPU NVIDIA B200, en España, con saldo en euros.
cómo empezar
Empieza gratis con 5 € al crear tu cuenta, o elige un bundle (10 / 50 / 200 / 1000 €) con bonus. El saldo no caduca.
En la prueba gratis solo confirmas tu cuenta. Si eliges bundle, pagas en la pasarela segura de Stripe, en euros.
Te llega por email junto al acceso al panel de administración. Apuntas tu SDK a GPUFlow y haces el primer curl.
compatibilidad
Token Factory habla el protocolo de OpenAI (/v1/chat/completions) y el de Anthropic (/v1/messages). Si ya usas cualquiera de los dos SDK, solo cambias el endpoint.
endpoints
POST /v1/chat/completionsPOST /v1/messagesbase url · https://api.gpuflow.ai
catálogo
DeepSeek, GLM, Qwen y Gemma, servidos en nuestra infraestructura. Precio por millón de tokens, con desglose entrada/salida. Si necesitas otro y entra en la GPU, lo desplegamos.
| modelo | capacidades | entrada · €/Mtok | salida · €/Mtok | ficha |
|---|---|---|---|---|
DeepSeek V4 Pro 1,6T MoE en 8× B200. Razonamiento de máxima potencia. ChatCódigoRazonamientoHerramientas | ChatCódigoRazonamientoHerramientas | 0,80 € | 2,60 € | ficha |
GLM 5.2 NVFP4 743B NVFP4 en 8× B200. Generalista y coding con tool calling. ChatCódigoRazonamientoHerramientasContexto largo | ChatCódigoRazonamientoHerramientasContexto largo | 1,00 € | 3,00 € | ficha |
DeepSeek V4 Flash 1,6T MoE en 2× B200. Alto throughput y contexto de 524K. ChatRazonamientoHerramientas | ChatRazonamientoHerramientas | 0,14 € | 0,28 € | ficha |
Qwen3.6 27B 27B denso. Fuerte en coding y agentes, con tool calling. ChatRazonamientoHerramientasOCR | ChatRazonamientoHerramientasOCR | 0,30 € | 2,40 € | ficha |
Qwen3 14B 14B FP8. Razonamiento con presupuesto de pensamiento. ChatRazonamientoHerramientas | ChatRazonamientoHerramientas | 0,20 € | 1,00 € | ficha |
Qwen3.5 9B 9B ultraligero. Rápido y económico, con tool calling. ChatRazonamientoHerramientas | ChatRazonamientoHerramientas | 0,10 € | 0,15 € | ficha |
Gemma 4 26B A4B MoE multimodal, ~3.8B activos. Visión, razonamiento y herramientas. RazonamientoHerramientas | RazonamientoHerramientas | 0,12 € | 0,30 € | ficha |
Nemotron Nano 12B VL Modelo visión-lenguaje para OCR y comprensión de documentos. Contexto 128K, hasta 4 imágenes por prompt. image-text-to-textOCR | image-text-to-textOCR | 0,06 € | 0,24 € | ficha |
Qwen3-VL 32B OCR Modelo visión-lenguaje para OCR y comprensión de documentos. Contexto 64K, hasta 4 imágenes por prompt. image-text-to-textOCR | image-text-to-textOCR | 0,10 € | 0,35 € | ficha |
Nemotron 3.5 Lightning 30B Híbrido MoE + Mamba-2, ~3B activos. Razonamiento y tool calling, contexto 128K. RazonamientoHerramientas | RazonamientoHerramientas | 0,12 € | 0,30 € | ficha |
rendimiento
El tiempo hasta el primer token es lo que nota tu usuario. Lo cuidamos a nivel de hardware.
El tiempo hasta el primer token, la métrica que de verdad nota el usuario (no los tokens/segundo de folleto). Lo bajamos con prefix caching y chunked prefill en el motor.
Aceleradores de última generación en bare metal. Sin tenant compartido que te robe latencia en hora punta.
Baja latencia entre nodos. Si lo combinas con un Sandbox, las llamadas no salen a internet pública.
ver en acción
Compatible con los SDK de OpenAI y Anthropic: cambia la URL base, pega tu key y ya estás llamando a 15 modelos open source servidos en GPU B200.
from openai import OpenAI
client = OpenAI(base_url="https://api.gpuflow.ai/v1",
api_key=os.environ["GPUFLOW_API_KEY"])
stream = client.chat.completions.create(
model="qwen-3.5-9b",
messages=[{"role": "user", "content": "¿Qué es GPUFlow? Respóndeme en una frase."}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")respuesta
Demo en vivo con límite de uso · respuesta de un modelo pequeño. Para producción, abre tu cuenta.
precios
Cargas saldo, consumes por tokens, ves el gasto en el panel. Sin cuotas, sin mínimos, sin conversión de divisa.
preguntas frecuentes
No. Token Factory habla el protocolo de OpenAI (/v1/chat/completions) y el de Anthropic (/v1/messages). Apuntas el SDK que ya usas a https://api.gpuflow.ai, pegas tu key y el resto de tu código no se toca.
Los 15 del catálogo (DeepSeek, GLM, Qwen, Gemma, NVIDIA, OpenAI, Mistral y Fish Audio), todos con la misma API key. Si necesitas otro modelo open source y entra en la GPU, lo desplegamos.
Consumes contra tu saldo prepago: pagas por tokens hasta donde tengas cargado, sin cuotas ni mínimos. Si necesitas volumen alto sostenido, escríbenos y ajustamos los límites de tu cuenta.
No. Tus prompts y respuestas se procesan para servir tu petición y no se usan para entrenar modelos. El detalle está en la política de privacidad.
En nuestro datacenter en España, sobre GPU NVIDIA B200 dedicada. Los datos no salen de Europa.
Publicamos la disponibilidad en la página de estado. Para un SLA contractual (cuentas enterprise), escríbenos y lo acordamos.
Crea la cuenta y llama a cualquier modelo del catálogo. Sin tarjeta.