blog sobre rendimiento
6 min de lecturaPor qué medimos en TTFT y no en tokens/segundo
Casi todos los proveedores de inferencia presumen de tokens por segundo. Es un número grande, impresiona en una tabla y no es lo que siente tu usuario. Lo que percibe una persona delante de un chat o un agente es cuánto tarda en aparecer la primera palabra: el TTFT, time to first token.
En GPU Flow optimizamos y publicamos el TTFT como métrica principal. Aquí está el razonamiento, y qué hacemos a nivel de hardware y software para bajarlo.
TTFT, lo que siente tu usuario
El silencio hasta la primera palabra. En GPU Flow, menos de 100 ms desde España.
tokens/s, el número de folleto
El ritmo una vez ya está respondiendo. Importa en lotes, no en chats.
Throughput es para folletos, TTFT es para usuarios
Los tokens por segundo (throughput) miden el ritmo de generación una vez que el modelo ya está respondiendo. Importan de verdad en cargas por lotes: procesar mil documentos de noche, indexar un archivo entero.
Pero en una experiencia interactiva (un chat, un copiloto, un agente que razona) el usuario nota sobre todo el silencio inicial: el tiempo hasta que aparece el primer token. Con streaming, una vez empieza a salir texto la percepción de velocidad ya está ganada, aunque el throughput sea moderado. Un TTFT alto se siente como una app rota; un throughput medio con TTFT bajo se siente fluido.
Qué hace lento al primer token
El TTFT lo dominan tres cosas: la distancia de red hasta el datacenter, el tiempo de cola si la GPU está saturada, y el prefill, que es procesar tu prompt completo antes de emitir el primer token. Cuanto más largo el contexto, más pesa el prefill.
Optimizar throughput (lotes grandes, más secuencias en paralelo) muchas veces empeora el TTFT, porque tu petición espera a llenar un lote. Son objetivos en tensión: elegir cuál priorizas es una decisión de producto, no solo de ingeniería.
Qué hacemos para bajarlo
Trabajamos las tres capas donde se pierde el primer token:
Hardware
GPU NVIDIA B200 dedicada, sin otro inquilino que te robe latencia en hora punta, y datacenter en España, que acorta la distancia de red para Europa Occidental.
Software
En el motor que sirve los modelos (vLLM) reutilizamos el cálculo de los trozos de prompt que se repiten, que en un asistente son casi todos, y troceamos el prefill para que la primera palabra salga antes cuando el contexto es largo. En la mayor parte del catálogo, no en todo: los modelos de visión y el de arquitectura híbrida no admiten ese cacheo, y ahí no lo activamos.
Red
Si combinas Token Factory con un Sandbox, las llamadas viajan por la red interna del clúster y no salen a internet: menos saltos, menos latencia y tus datos sin salir del perímetro europeo.
Cuándo sí importa el throughput
No decimos que los tokens por segundo no importen. Para generación muy larga (informes, traducciones masivas) o pipelines por lotes, el throughput manda y conviene medirlo. Lo que evitamos es liderar con el número que mejor queda en una tabla en vez del que mejor describe la experiencia real.
Por eso publicamos el TTFT y lo cuidamos a nivel de hardware: es la métrica honesta para inferencia interactiva.
Mídelo tú mismo
El demo de Token Factory muestra el TTFT real de cada respuesta. Pruébalo, o conéctate con 50 € de saldo gratis y mide con tu propio prompt.