home/categories/academic/applied-artificial-intelligence-claude-code-toolkit-skills-llm-evaluation-skill-md

academicresearch

llm-evaluation

LLM evaluation and testing patterns including prompt testing, hallucination detection, benchmark creation, and quality metrics. Use when testing LLM applications, validating prompt quality, implementing systematic evaluation, or measuring LLM performance.

Ver código-fonte academic

maintainer

applied-artificial-intelligence

Atualizado 1/14/2026

Estrelas

Forks

quick start

Installation and usage

Instalação

$ install --globalskills.sh

Uso

Depois de instalar, você pode usar esta skill executando o seguinte comando no terminal:

skills use llm-evaluation