Agent skill · shipshitdev
advanced-evaluation
Design and operate LLM-as-a-Judge evaluation systems using direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence s
Reference it in any coding agent with:
@skills shipshitdev/advanced-evaluation