evals: switch the default LLM judge to claude-haiku-4-5

Replaces gpt-5-mini-2025-08-07 as the default judge everywhere: the 147
eval configs plus the hardcoded defaults in the evals CLI, recipe composer,
comparison config generator, taubench user-simulator, trial runner and
OptimizeConfig.

Haiku is roughly 3x faster on the judging path and we are out of OpenAI
quota, so gpt-5-mini was failing closed on long eval runs.
This commit is contained in:
Andrew Park
2026-07-11 11:59:32 -07:00
parent f338d64b21
commit 08fe3a6c98
159 changed files with 165 additions and 165 deletions
+1 -1
View File
@@ -1408,7 +1408,7 @@ class OptimizeConfig:
optimizer_provider: str = "anthropic"
benchmark: str = ""
max_samples: int = 50
judge_model: str = "gpt-5-mini-2025-08-07"
judge_model: str = "claude-haiku-4-5-20251001"
db_path: str = str(DEFAULT_CONFIG_DIR / "optimize.db")
+2 -2
View File
@@ -1141,7 +1141,7 @@ def main():
"-n", "--max-samples", type=int, default=None, help="Maximum samples to evaluate"
)
@click.option("-w", "--max-workers", type=int, default=4, help="Parallel workers")
@click.option("--judge-model", default="gpt-5-mini-2025-08-07", help="LLM judge model")
@click.option("--judge-model", default="claude-haiku-4-5-20251001", help="LLM judge model")
@click.option("-o", "--output", "output_path", default=None, help="Output JSONL path")
@click.option("--seed", type=int, default=42, help="Random seed")
@click.option("--split", "dataset_split", default=None, help="Dataset split override")
@@ -1387,7 +1387,7 @@ def run(
"-n", "--max-samples", type=int, default=None, help="Max samples per benchmark"
)
@click.option("-w", "--max-workers", type=int, default=4, help="Parallel workers")
@click.option("--judge-model", default="gpt-5-mini-2025-08-07", help="LLM judge model")
@click.option("--judge-model", default="claude-haiku-4-5-20251001", help="LLM judge model")
@click.option("--output-dir", default="results/", help="Output directory for results")
@click.option("--seed", type=int, default=42, help="Random seed")
@click.option("-v", "--verbose", is_flag=True, help="Verbose logging")
@@ -98,7 +98,7 @@ BENCHMARKS: Dict[str, Dict[str, object]] = {
},
}
DEFAULT_JUDGE_MODEL = "gpt-5-mini-2025-08-07"
DEFAULT_JUDGE_MODEL = "claude-haiku-4-5-20251001"
def _template_path() -> Path:
@@ -11,7 +11,7 @@ temperature = 0.6
max_tokens = 32768
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 1024
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
+1 -1
View File
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 1.0
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 2048
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 2048
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 2048
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 1024
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 2048
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 1024
@@ -12,7 +12,7 @@ temperature = 0.6
max_tokens = 32768
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -12,7 +12,7 @@ temperature = 1.0 # Kimi-K2.5 thinking mode recommended
max_tokens = 32768
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -11,7 +11,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 1024
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -17,7 +17,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -14,7 +14,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.0
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 16384
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -12,7 +12,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -11,7 +11,7 @@ temperature = 0.6
max_tokens = 32768
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 1024
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -8,7 +8,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -11,7 +11,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -11,7 +11,7 @@ temperature = 0.6
max_tokens = 8192 # 8x increase from baseline 1024
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -10,7 +10,7 @@ temperature = 0.6 # Qwen3.5 recommended
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -11,7 +11,7 @@ temperature = 0.6
max_tokens = 8192
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
@@ -14,7 +14,7 @@ temperature = 0.6 # Qwen3.5 thinking mode (precise analysis)
max_tokens = 32768 # Qwen3.5 recommended for general queries
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 1024
@@ -14,7 +14,7 @@ temperature = 0.6 # Qwen3.5 thinking mode recommended
max_tokens = 1024 # Keep short to prevent hangs; answers are brief
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 4096
+1 -1
View File
@@ -14,7 +14,7 @@ temperature = 0.0
max_tokens = 2048
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 512
@@ -13,7 +13,7 @@ temperature = 0.0
max_tokens = 2048
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 512
@@ -13,7 +13,7 @@ temperature = 0.0
max_tokens = 2048
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
max_tokens = 512
@@ -10,7 +10,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -10,7 +10,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -17,7 +17,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"
@@ -14,7 +14,7 @@ temperature = 0.7
max_tokens = 4096
[judge]
model = "gpt-5-mini-2025-08-07"
model = "claude-haiku-4-5-20251001"
temperature = 0.0
engine = "cloud"

Some files were not shown because too many files have changed in this diff Show More