moro72842's picture
Add benchmark hardening pipeline: GPQA, ARC, IFEval, PHYBench, adversarial defense
6301e6c verified
|
Raw
History Blame Contribute Delete
1.02 kB
metadata
license: apache-2.0
tags:
  - grpo
  - benchmark-hardening
  - adversarial
  - gpqa
  - ifeval
  - physics
base_model:
  - Qwen/Qwen2.5-3B-Instruct
datasets:
  - Wanfq/gpqa
  - allenai/ai2_arc
  - google/IFEval
  - Eureka-Lab/PHYBench

Sovereign-Hardened-V1

Multi-benchmark GRPO hardening with 6-signal reward stack and self-healing callback.

Benchmarks Covered

Benchmark Dataset Reward Type
GPQA Diamond Wanfq/gpqa (198 PhD-level MCQs) Letter-match MCQ
ARC-Challenge allenai/ai2_arc (1172 MCQs) Letter-match MCQ
IFEval google/IFEval (541 IF prompts) Rule-based constraint verification
PHYBench Eureka-Lab/PHYBench (500 physics) Numeric/symbolic match
Adversarial Generated (injection + IF + tools) Injection defense + graceful recovery

Self-Healing

Plateau → β×1.5 + LR×0.5 | Collapse → checkpoint + stop

Launch

pip install trl transformers torch datasets accelerate trackio
python benchmark_hardening.py