GLM 5.3 NVFP4
Todoterreno para escribir y programar, con manejo de herramientas.
Lee de una vez
≈ 2.200 páginas
1.048.576 tokens
Tamaño del cerebro
Muy grande
753B MoE, 40B active, NVFP4
Dónde funciona
España (UE)
8× B200
Entiende
Texto, no imágenes
Chat, Código, Razonamiento, Herramientas
En qué destaca
- Razonamiento. Piensa en varios pasos antes de responder, para problemas que no salen de una.
- Código. Entiende bases de código grandes y propone cambios completos.
- Herramientas. Busca, consulta datos y llama a otros sistemas. Es la base de un agente.
- MoE. Mixture of Experts, «mezcla de expertos»: parte las tareas grandes y las reparte entre especialistas, encendiendo solo los que necesita. Rinde como un modelo enorme sin costar como uno.
- Contexto largo. Se lee documentos enormes de una sentada sin perder el hilo.
¿Solo necesitas chat sencillo, clasificar o traducir? Qwen3.5 9B lo hace por una fracción del precio, y cambiar de modelo es cambiar una palabra.
Precio
€ por millón de tokens, IVA incluido
Le envías (entrada)1,206 €
Te responde (salida)3,789 €
Releer lo repetido (caché)0,224 €
1.000 respuestas de chat~1,74 €
Analizar un contrato de 200 páginas~0,12 €
probar con 50 € gratisSin tarjeta. Dan para unas 28.741 respuestas.
Para tu equipo técnico
Compatible con el SDK de OpenAI: cambias la URL base y la clave, y listo.
curl https://api.gpuflow.ai/v1/chat/completions \
-H "Authorization: Bearer $GPUFLOW_API_KEY" \
-d '{ "model": "glm-5.3-nvfp4",
"messages": [{ "role": "user", "content": "Hola" }] }'