{ "schema_version": "0.2.2", "evaluation_id": "mmlu_pro_chat/RedHatAI/Qwen3.6-35B-A3B-NVFP4/1782388472.716288", "evaluation_timestamp": "1782225973", "retrieved_timestamp": "1782388472.716288", "source_metadata": { "source_name": "lm-evaluation-harness", "source_type": "evaluation_run", "source_organization_name": "RedHatAI", "evaluator_relationship": "third_party" }, "eval_library": { "name": "lm_eval", "version": "0.4.13.dev0" }, "model_info": { "name": "RedHatAI/Qwen3.6-35B-A3B-NVFP4", "id": "RedHatAI/Qwen3.6-35B-A3B-NVFP4", "developer": "RedHatAI", "additional_details": { "model_args": "{'model': 'RedHatAI/Qwen3.6-35B-A3B-NVFP4', 'max_length': 262144, 'base_url': 'http://0.0.0.0:8703/v1/chat/completions', 'num_concurrent': 64, 'max_retries': 3, 'tokenized_requests': False, 'tokenizer_backend': None, 'timeout': 1200}", "num_seeds_merged": "3" } }, "evaluation_results": [ { "evaluation_name": "mmlu_pro_chat/custom-extract", "source_data": { "dataset_name": "mmlu_pro_chat", "source_type": "other" }, "metric_config": { "evaluation_description": "exact_match (filter: custom-extract)", "lower_is_better": false, "score_type": "continuous", "min_score": 0.0, "max_score": 1.0 }, "score_details": { "score": 0.8470190602836879, "details": { "seed_scores": "[0.8468251329787234, 0.846908244680851, 0.8473238031914894]", "evaluation_timestamps": "[1782237524, 1782247059, 1782225973]" }, "uncertainty": { "standard_error": { "value": 0.00015424879108018015, "method": "across_seeds" }, "num_samples": 3 } } } ] }