Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег
Разбор пяти конфигураций собственного LLM-инференса для команды из 25 разработчиков: от рабочих флагов vLLM до трёх неочевидных багов. Главный вывод - при агентской нагрузке кэш префикса может сильнее влиять на экономику, чем выбор модели и объём GPU.



















