home/categories/containers/bagelhole-devops-security-agent-skills-infrastructure-local-ai-llm-inference-scaling-skill-md
containersdevops

llm-inference-scaling

Auto-scale LLM inference clusters on Kubernetes using KEDA, custom GPU metrics, and horizontal pod autoscaling. Handle traffic spikes, implement queue-based scaling, and optimize cost with spot instances for AI workloads.

BagelHole
maintainer
BagelHole
আপডেট হয়েছে 3/2/2026
স্টার
18
ফর্ক
2
quick start

Installation and usage

Auto-scale LLM inference clusters on Kubernetes using KEDA, custom GPU metrics, and horizontal pod autoscaling. Handle traffic spikes, implement queue-based scaling, and optimize cost with spot instances for AI workloads.

ইনস্টলেশন
$ install --globalskills.sh
ব্যবহার

ইনস্টল করার পর, টার্মিনালে নিচের কমান্ড চালিয়ে আপনি এই স্কিল ব্যবহার করতে পারবেন:

skills use llm-inference-scaling