Tag: GPU inference

Perplexity reuses LLM kernels to keep embedding serving cheap

Engineers at Perplexity detail a GPU stack where batch and online embedding workloads borrow prefill and decode paths.