blog · rendimiento

Por qué medimos en TTFT y no en tokens/segundo

Casi todos los proveedores de inferencia presumen de tokens por segundo. Es un número grande, impresiona en una tabla y… no es lo que siente tu usuario. Lo que percibe una persona delante de un chat o un agente es cuánto tarda en aparecer la primera palabra: el TTFT (time to first token).

En GPU Flow optimizamos (y publicamos) el TTFT como métrica principal. Aquí está el razonamiento, y qué hacemos a nivel de hardware y software para bajarlo.

Throughput es para folletos; TTFT es para usuarios

Los tokens por segundo (throughput) miden el ritmo de generación una vez que el modelo ya está respondiendo. Importan de verdad en cargas por lotes: procesar mil documentos de noche, generar embeddings masivos, etc.

Pero en una experiencia interactiva (un chat, un copiloto, un agente que razona) el usuario nota sobre todo el silencio inicial: el tiempo hasta que aparece el primer token. Con streaming, una vez empieza a salir texto la percepción de velocidad ya está ganada, aunque el throughput sea moderado. Un TTFT alto se siente como una app rota; un throughput medio con TTFT bajo se siente fluido.

Qué hace lento al primer token

El TTFT lo dominan tres cosas: la distancia de red hasta el datacenter, el tiempo de cola si la GPU está saturada, y el "prefill", procesar tu prompt completo antes de emitir el primer token. Cuanto más largo el contexto, más pesa el prefill.

Optimizar throughput (lotes grandes, más secuencias en paralelo) muchas veces empeora el TTFT, porque tu petición espera a llenar un lote. Son objetivos en tensión: elegir cuál priorizas es una decisión de producto, no solo de ingeniería.

Qué hacemos para bajarlo

Hardware: GPU NVIDIA B200 (Blackwell) dedicada, sin tenant compartido que te robe latencia en hora punta. Datacenter en España, que minimiza la distancia de red para usuarios en Europa Occidental.

Software: en el motor vLLM activamos prefix caching (reutilizar el cómputo de prefijos repetidos, típico en prompts de sistema y RAG) y chunked prefill (trocear el prefill para que el primer token salga antes en contextos largos).

Red: si combinas Token Factory con un Sandbox, las llamadas viajan por la red interna RDMA del clúster y no salen a internet pública, menos saltos, menos latencia, y tus datos sin abandonar el perímetro.

Cuándo sí importa el throughput

No decimos que los tokens por segundo no importen. Para generación muy larga (informes, traducciones masivas) o pipelines por lotes, el throughput manda y conviene medirlo. Lo que evitamos es liderar con el número que mejor queda en una tabla en vez del que mejor describe la experiencia real.

Por eso publicamos el TTFT y lo cuidamos a nivel de hardware: es la métrica honesta para inferencia interactiva.

Mídelo tú mismo

El demo de Token Factory muestra el TTFT real de cada respuesta. Pruébalo, o conéctate con 5 € de saldo gratis y mide con tu propio prompt.

ver Token Factory