Ryan Brooks
@rbro112
It’s been a week since I moved one of eval datasets from Gemini 3.1 to Jev by @typesafeai for LLM judging. The results so far:
- No meaningful change in scoring accuracy
- ~200× cheaper (~$0.01 → ~$0.00005 per judge)
- ~50× faster (~10s → ~0.2s median)
- ~50% fewer input
- No meaningful change in scoring accuracy
- ~200× cheaper (~$0.01 → ~$0.00005 per judge)
- ~50× faster (~10s → ~0.2s median)
- ~50% fewer input
16 110
Ryan Brooks