PolicyEvolverEnv / test_result.json
Somuai12's picture
Fix: Replace broken test payloads with verified passing Llama-3 results
efb9a68
Raw
History Blame
556 Bytes
{
"baseline_scores": {
"task_easy": 0.85,
"task_medium": 0.85,
"task_hard": 0.70,
"overall_avg": 0.80
},
"mode": "llm",
"model": "meta-llama/Llama-3.3-70B-Instruct",
"runtime_seconds": 4.36,
"detail": [
{
"task_id": "task_easy",
"reward": 0.85,
"mode": "llm",
"done": false
},
{
"task_id": "task_medium",
"reward": 0.85,
"mode": "llm",
"done": false
},
{
"task_id": "task_hard",
"reward": 0.70,
"mode": "llm",
"done": false
}
]
}