Agent skill · vasilyu1983

ai-llm-inference

LLM inference patterns — latency budgeting, caching, batching, quantization, and parallelism. Use when optimizing serving cost or tail latency.

Reference it in any coding agent with:

@skills vasilyu1983/ai-llm-inference

Browse the @skills marketplace