Agent skill · vasilyu1983
ai-llm-inference
LLM inference patterns — latency budgeting, caching, batching, quantization, and parallelism. Use when optimizing serving cost or tail latency.
Reference it in any coding agent with:
@skills vasilyu1983/ai-llm-inference