From an engineer with Valery Novitsky - How we speed up LLM work
Yandex for Backend · 65:24
Инференс больших языковых моделей — это не «тот же forward, что на обучении», а двухфазный конвейер: prefill хорошо грузит GPU, а decode превращает матричные умножения в матрично-векторные и оставляет тензорные ядра п...