Claudio Mascaro

Notas

As três medidas que transformam "está lento" em diagnóstico

Tempo até o primeiro token, tempo total de geração e número de tokens de saída separam um chat lento por espera de um chat lento por escrita.

"Está lento" é uma reclamação legítima e um diagnóstico inútil: ela não diz o que consertar. A documentação de métricas de serving de modelos nomeia as peças que faltam.

A primeira é o tempo até o primeiro token, definido como "the time elapsed between submitting a prompt and receiving the first token of the model's response". É a espera silenciosa: nela cabem a fila do provedor, o processamento do prompt e, quando há recuperação, a busca na base. A segunda é o tempo total de geração, que corre depois, token a token. A soma das duas é a latência que o visitante sente.

A terceira medida não é de tempo e é a que mais explica a segunda: quantos tokens a resposta tem. Uma resposta que sai em três parágrafos leva alguns múltiplos do tempo de uma que sai em três linhas, com a mesma infraestrutura e o mesmo modelo.

Com as três, cada suspeita vira teste. Espera longa antes de aparecer a primeira palavra aponta para fila, prompt ou busca. Primeira palavra rápida e resposta que se arrasta aponta para o tamanho da saída ou para a velocidade de geração do modelo escolhido. São consertos diferentes, e nenhum deles é adivinhável a partir da sensação de lentidão.