Servidor MCP
Conecta GPUFlow a Claude, Cursor o tu agente: lista modelos y chatea con ellos como herramientas MCP. Más herramientas pronto.
npx @gpuflow/mcpdesarrolladores
Una API compatible con tu SDK, una CLI para los tres servicios y un servidor MCP para que tus agentes la usen solos. Empieza en segundos; la referencia completa, abajo.
Del signup al primer token, sin reescribir tu código.
Crea tu cuenta y recibes 5 € de saldo. La key te llega por email.
Cambia la URL base a https://api.gpuflow.ai/v1 y pega tu key. El resto de tu código no se toca.
Llama a cualquiera de los 16 modelos del catálogo con el SDK de OpenAI o Anthropic.
curl https://api.gpuflow.ai/v1/chat/completions \
-H "Authorization: Bearer $GPUFLOW_API_KEY" \
-d '{ "model": "deepseek-v4-flash",
"messages": [{ "role": "user", "content": "Hola" }] }'Una sola herramienta para tu inferencia. Los comandos models y chat ya funcionan contra la API; la gestión de cuenta, sandboxes y GPU llegan a la misma CLI.
$ npm i -g @gpuflow/cli# configura tu API key
$ gpuflow config set api-key gpf-...
# lista el catálogo de modelos (en vivo)
$ gpuflow models
# habla con un modelo (streaming)
$ gpuflow chat "Explícame RDMA en una frase"
GPUFlow es agent-native: tus agentes la usan por MCP, por su SDK, o desde un Sandbox con el agente ya instalado.
Conecta GPUFlow a Claude, Cursor o tu agente: lista modelos y chatea con ellos como herramientas MCP. Más herramientas pronto.
npx @gpuflow/mcpLos Sandbox arrancan con Claude Code, OpenCode, OpenClaw o Hermes ya instalados y conectados a la API por red interna.
Cualquier agente que use el SDK de OpenAI o Anthropic funciona apuntando a GPUFlow, sin capa de traducción.
Incluye tu API key en la cabecera Authorization como Bearer token. Puedes crear y gestionar tus keys desde el dashboard.
Authorization: Bearer gpf-...
Endpoint principal compatible con el SDK de OpenAI. Soporta streaming, function calling y los modelos del catálogo.
Endpoint compatible con el SDK de Anthropic. Misma funcionalidad, formato de mensajes Anthropic.
Lista los modelos disponibles con sus precios y capacidades.
Añade "stream": true y recibes la respuesta por Server-Sent Events, token a token. Inyectamos keep-alives para que las conexiones largas no se corten en proxies intermedios.
Los modelos del catálogo razonan. Controla el presupuesto de pensamiento con reasoning.effort ("low", "medium", "high" o "none" para desactivarlo) o con reasoning.max_tokens. Funciona desde el SDK de OpenAI y de Anthropic (thinking.budget_tokens), lo traducimos al motor por ti.
{ "model": "deepseek-v4-pro",
"messages": [{ "role": "user", "content": "Resuélvelo paso a paso" }],
"stream": true,
"reasoning": { "effort": "high" } }Los 10 modelos soportan herramientas (tool calling) con el formato estándar de OpenAI. Pasa tu array de tools y el modelo decide cuándo invocarlas; tú ejecutas la función y devuelves el resultado.
{ "model": "qwen-3.8-27b",
"messages": [{ "role": "user", "content": "¿Qué tiempo hace en Madrid?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } }
}
}
}] }from openai import OpenAI
client = OpenAI(
base_url="https://api.gpuflow.ai/v1",
api_key="gpf-..."
)
response = client.chat.completions.create(
model="qwen-3.5-9b",
messages=[{"role": "user", "content": "Hello!"}],
max_tokens=10000
)
print(response.choices[0].message.content)import Anthropic from "@anthropic-ai/sdk";
const client = new Anthropic({
baseURL: "https://api.gpuflow.ai",
apiKey: "gpf-..."
});
const msg = await client.messages.create({
model: "qwen-3.5-9b",
max_tokens: 10000,
messages: [{ role: "user", content: "Hello!" }]
});
console.log(msg.content[0].text);curl https://api.gpuflow.ai/v1/chat/completions \
-H "Authorization: Bearer gpf-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-3.5-9b",
"messages": [{"role": "user", "content": "Hello!"}],
"max_tokens": 10000
}'Todos los modelos corren en nuestra infraestructura en España. Precios por millón de tokens.
| modelo | entrada EUR/M | salida EUR/M | capacidades |
|---|---|---|---|
| deepseek-v4-prodestacado | 0,80 € | 2,60 € | Chat, Código, Razonamiento, Herramientas |
| glm-5.2-nvfp4destacado | 1,00 € | 3,00 € | Chat, Código, Razonamiento, Herramientas, Contexto largo |
| deepseek-v4-flash | 0,14 € | 0,28 € | Chat, Razonamiento, Herramientas |
| qwen-3.8-27b | 0,10 € | 0,30 € | Razonamiento, json_mode |
| qwen-3-14b | 0,20 € | 1,00 € | Chat, Razonamiento, Herramientas |
| qwen-3.5-9b | 0,10 € | 0,15 € | Chat, Razonamiento, Herramientas |
| gemma-4-26b-a4b | 0,12 € | 0,30 € | Razonamiento, Herramientas |
| nemotron-nano-12b-v2-vl | 0,06 € | 0,24 € | image-text-to-text, OCR |
| qwen3-vl-32b-ocr | 0,10 € | 0,35 € | image-text-to-text, OCR |
| nemotron-3.5-lightning-30b-a3b | 0,12 € | 0,30 € | Razonamiento, Herramientas |