llm-judge-independence
itsjustmarsel/llm-judge-independence
Python
A diverse 6-LLM judge committee (4 labs, 3 countries) has correlated errors: ~1.9 effective independent judges of 6 (mean pairwise error-correlation ρ≈0.42) on RAGTruth. Provider diversity does not buy error-independence. Verdicts + one-command recompute included.