Text Generation
Transformers
Safetensors
GGUF
English
qwen3_5
image-text-to-text
decision-model
typed-decisions
calibration
calibrated-probabilities
classification
tool-selection
agent-routing
decision-index
jevbench
jev-compatible
systemone
wald
wald-q4b
qwen3.5
4b
vllm
reasoning
llama.cpp
conversational
Eval Results (legacy)
Instructions to use org2ai/Wald-4B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use org2ai/Wald-4B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="org2ai/Wald-4B") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("org2ai/Wald-4B") model = AutoModelForMultimodalLM.from_pretrained("org2ai/Wald-4B", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use org2ai/Wald-4B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "org2ai/Wald-4B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "org2ai/Wald-4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/org2ai/Wald-4B
- SGLang
How to use org2ai/Wald-4B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "org2ai/Wald-4B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "org2ai/Wald-4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "org2ai/Wald-4B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "org2ai/Wald-4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use org2ai/Wald-4B with Docker Model Runner:
docker model run hf.co/org2ai/Wald-4B
Download figures/data.json from org2ai/Wald-4B: direct link, hf CLI and curl.
- Browser
- Download file 31.9 kB
-
https://huggingface.co/org2ai/Wald-4B/resolve/5428adeb2c54ad99a9ebebf737be670b766e8595/figures/data.json
- Command line
-
hf download hf://org2ai/Wald-4B@5428adeb2c54ad99a9ebebf737be670b766e8595/figures/data.json
-
curl -L -o data.json https://huggingface.co/org2ai/Wald-4B/resolve/5428adeb2c54ad99a9ebebf737be670b766e8595/figures/data.json
31.9 kB
| { | |
| "board": { | |
| "edition": "release-v2.1", | |
| "generated_utc": "2026-09-27T03:42:13+00:00", | |
| "jev": { | |
| "index": 57.91, | |
| "areas": { | |
| "knowledge": 0.514, | |
| "language": 0.6202, | |
| "retrieval": 0.5542, | |
| "tools": 0.7509, | |
| "arts": 0.3766 | |
| } | |
| }, | |
| "entries": [ | |
| { | |
| "rank": 1, | |
| "name": "Surogate Rune 26B-A4B v3", | |
| "size_b": 26.0, | |
| "base_model": "google/gemma-4-26B-A4B-it", | |
| "kind": "full fine-tune", | |
| "index": 57.44, | |
| "areas": { | |
| "knowledge": 0.4336, | |
| "language": 0.6306, | |
| "retrieval": 0.6352, | |
| "tools": 0.7122, | |
| "arts": 0.419 | |
| } | |
| }, | |
| { | |
| "rank": 2, | |
| "name": "Decider chat \u00b7 Gemma-4-31B", | |
| "size_b": 31.0, | |
| "base_model": "google/gemma-4-31B", | |
| "kind": "inference technique", | |
| "index": 57.33, | |
| "areas": { | |
| "knowledge": 0.4427, | |
| "language": 0.6038, | |
| "retrieval": 0.6308, | |
| "tools": 0.7557, | |
| "arts": 0.3834 | |
| } | |
| }, | |
| { | |
| "rank": 3, | |
| "name": "AutoJev-27B", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "full fine-tune", | |
| "index": 56.4, | |
| "areas": { | |
| "knowledge": 0.4088, | |
| "language": 0.6346, | |
| "retrieval": 0.5486, | |
| "tools": 0.7935, | |
| "arts": 0.3939 | |
| } | |
| }, | |
| { | |
| "rank": 4, | |
| "name": "simple-jev \u00b7 Qwen3.8-27B (featherless)", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "inference technique", | |
| "index": 55.74, | |
| "areas": { | |
| "knowledge": 0.3656, | |
| "language": 0.6209, | |
| "retrieval": 0.6325, | |
| "tools": 0.7621, | |
| "arts": 0.3648 | |
| } | |
| }, | |
| { | |
| "rank": 5, | |
| "name": "Jebadiah 27B", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "LoRA", | |
| "index": 54.67, | |
| "areas": { | |
| "knowledge": 0.3884, | |
| "language": 0.6068, | |
| "retrieval": 0.5389, | |
| "tools": 0.7813, | |
| "arts": 0.3873 | |
| } | |
| }, | |
| { | |
| "rank": 6, | |
| "name": "reflex 27B", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "inference technique", | |
| "index": 52.16, | |
| "areas": { | |
| "knowledge": 0.3511, | |
| "language": 0.5416, | |
| "retrieval": 0.5781, | |
| "tools": 0.7412, | |
| "arts": 0.3965 | |
| } | |
| }, | |
| { | |
| "rank": 7, | |
| "name": "Decider chat \u00b7 Qwen3.6-27B", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.6-27B", | |
| "kind": "inference technique", | |
| "index": 51.35, | |
| "areas": { | |
| "knowledge": 0.3699, | |
| "language": 0.5712, | |
| "retrieval": 0.5223, | |
| "tools": 0.7142, | |
| "arts": 0.3506 | |
| } | |
| }, | |
| { | |
| "rank": 8, | |
| "name": "Winnow-12B", | |
| "size_b": 12.0, | |
| "base_model": "google/gemma-4-12B", | |
| "kind": "LoRA", | |
| "index": 50.02, | |
| "areas": { | |
| "knowledge": 0.3382, | |
| "language": 0.5599, | |
| "retrieval": 0.5405, | |
| "tools": 0.7102, | |
| "arts": 0.2997 | |
| } | |
| }, | |
| { | |
| "rank": 9, | |
| "name": "JoshuaSP diffusiongemma (open-jev)", | |
| "size_b": 26.0, | |
| "base_model": "google/diffusiongemma-26B-A4B-it", | |
| "kind": "inference technique", | |
| "index": 49.47, | |
| "areas": { | |
| "knowledge": 0.3272, | |
| "language": 0.5351, | |
| "retrieval": 0.5837, | |
| "tools": 0.7016, | |
| "arts": 0.2665 | |
| } | |
| }, | |
| { | |
| "rank": 10, | |
| "name": "Jevfire", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "inference technique", | |
| "index": 49.37, | |
| "areas": { | |
| "knowledge": 0.3048, | |
| "language": 0.5334, | |
| "retrieval": 0.5622, | |
| "tools": 0.7233, | |
| "arts": 0.3221 | |
| } | |
| }, | |
| { | |
| "rank": 11, | |
| "name": "Decider 35B-A3B", | |
| "size_b": 35.0, | |
| "base_model": "Qwen/Qwen3.5-35B-A3B-Base", | |
| "kind": "full fine-tune", | |
| "index": 47.11, | |
| "areas": { | |
| "knowledge": 0.3178, | |
| "language": 0.5552, | |
| "retrieval": 0.5466, | |
| "tools": 0.5654, | |
| "arts": 0.326 | |
| } | |
| }, | |
| { | |
| "rank": 12, | |
| "name": "JPT-9B", | |
| "size_b": 9.0, | |
| "base_model": "Qwen/Qwen3.5-9B-Base", | |
| "kind": "LoRA", | |
| "index": 46.89, | |
| "areas": { | |
| "knowledge": 0.317, | |
| "language": 0.5672, | |
| "retrieval": 0.4459, | |
| "tools": 0.6702, | |
| "arts": 0.2856 | |
| } | |
| }, | |
| { | |
| "rank": 13, | |
| "name": "Decision 1.0 Lux", | |
| "size_b": 9.0, | |
| "base_model": "Qwen/Qwen3.5-9B-Base", | |
| "kind": "head / adapter", | |
| "index": 43.49, | |
| "areas": { | |
| "knowledge": 0.309, | |
| "language": 0.4797, | |
| "retrieval": 0.5002, | |
| "tools": 0.5719, | |
| "arts": 0.2635 | |
| } | |
| }, | |
| { | |
| "rank": 14, | |
| "name": "Xor", | |
| "size_b": 35.0, | |
| "base_model": "Qwen/Qwen3.6-35B-A3B", | |
| "kind": "full fine-tune", | |
| "index": 41.48, | |
| "areas": { | |
| "knowledge": 0.3433, | |
| "language": 0.5558, | |
| "retrieval": 0.2296, | |
| "tools": 0.5514, | |
| "arts": 0.3563 | |
| } | |
| }, | |
| { | |
| "rank": 15, | |
| "name": "Decider 4B", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "full fine-tune", | |
| "index": 40.7, | |
| "areas": { | |
| "knowledge": 0.2574, | |
| "language": 0.4597, | |
| "retrieval": 0.4467, | |
| "tools": 0.5862, | |
| "arts": 0.2503 | |
| } | |
| }, | |
| { | |
| "rank": 16, | |
| "name": "Jev-Omni", | |
| "size_b": 12.0, | |
| "base_model": "google/gemma-4-12B", | |
| "kind": "LoRA + head", | |
| "index": 40.53, | |
| "areas": { | |
| "knowledge": 0.2549, | |
| "language": 0.5052, | |
| "retrieval": 0.3583, | |
| "tools": 0.6077, | |
| "arts": 0.2607 | |
| } | |
| }, | |
| { | |
| "rank": 17, | |
| "name": "djev", | |
| "size_b": 26.0, | |
| "base_model": "google/diffusiongemma-26B-A4B-it", | |
| "kind": "inference technique", | |
| "index": 40.28, | |
| "areas": { | |
| "knowledge": 0.264, | |
| "language": 0.4876, | |
| "retrieval": 0.4177, | |
| "tools": 0.5168, | |
| "arts": 0.3045 | |
| } | |
| }, | |
| { | |
| "rank": 18, | |
| "name": "Winnow-E4B", | |
| "size_b": 4.0, | |
| "base_model": "google/gemma-4-E4B", | |
| "kind": "LoRA", | |
| "index": 39.89, | |
| "areas": { | |
| "knowledge": 0.2229, | |
| "language": 0.4511, | |
| "retrieval": 0.438, | |
| "tools": 0.6251, | |
| "arts": 0.2277 | |
| } | |
| }, | |
| { | |
| "rank": 19, | |
| "name": "Hopper", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "LoRA", | |
| "index": 39.67, | |
| "areas": { | |
| "knowledge": 0.2327, | |
| "language": 0.444, | |
| "retrieval": 0.4446, | |
| "tools": 0.5905, | |
| "arts": 0.248 | |
| } | |
| }, | |
| { | |
| "rank": 20, | |
| "name": "Bespoke Nimble 9B v2", | |
| "size_b": 9.0, | |
| "base_model": "Qwen/Qwen3.5-9B-Base", | |
| "kind": "LoRA", | |
| "index": 39.57, | |
| "areas": { | |
| "knowledge": 0.2952, | |
| "language": 0.4509, | |
| "retrieval": 0.3493, | |
| "tools": 0.5921, | |
| "arts": 0.2471 | |
| } | |
| }, | |
| { | |
| "rank": 21, | |
| "name": "JevK5", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "LoRA", | |
| "index": 38.81, | |
| "areas": { | |
| "knowledge": 0.235, | |
| "language": 0.4329, | |
| "retrieval": 0.4615, | |
| "tools": 0.5212, | |
| "arts": 0.2781 | |
| } | |
| }, | |
| { | |
| "rank": 22, | |
| "name": "lev", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "LoRA + head", | |
| "index": 38.54, | |
| "areas": { | |
| "knowledge": 0.2197, | |
| "language": 0.3852, | |
| "retrieval": 0.4792, | |
| "tools": 0.5752, | |
| "arts": 0.2796 | |
| } | |
| }, | |
| { | |
| "rank": 23, | |
| "name": "Kev 9B", | |
| "size_b": 9.0, | |
| "base_model": "Qwen/Qwen3.5-9B-Base", | |
| "kind": "LoRA + head", | |
| "index": 38.48, | |
| "areas": { | |
| "knowledge": 0.2616, | |
| "language": 0.4167, | |
| "retrieval": 0.4367, | |
| "tools": 0.5448, | |
| "arts": 0.2242 | |
| } | |
| }, | |
| { | |
| "rank": 24, | |
| "name": "Intern-Decision-4B", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "full fine-tune", | |
| "index": 37.81, | |
| "areas": { | |
| "knowledge": 0.2371, | |
| "language": 0.4188, | |
| "retrieval": 0.4034, | |
| "tools": 0.5566, | |
| "arts": 0.2608 | |
| } | |
| }, | |
| { | |
| "rank": 25, | |
| "name": "razorback16 openjev diffusiongemma (NVFP4, vLLM)", | |
| "size_b": 26.0, | |
| "base_model": "google/diffusiongemma-26B-A4B-it", | |
| "kind": "inference technique", | |
| "index": 37.25, | |
| "areas": { | |
| "knowledge": 0.2618, | |
| "language": 0.4486, | |
| "retrieval": 0.3702, | |
| "tools": 0.4719, | |
| "arts": 0.285 | |
| } | |
| }, | |
| { | |
| "rank": 26, | |
| "name": "NeoHorse-Jev-4B", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "head / adapter", | |
| "index": 36.75, | |
| "areas": { | |
| "knowledge": 0.2259, | |
| "language": 0.3936, | |
| "retrieval": 0.4391, | |
| "tools": 0.5888, | |
| "arts": 0.1177 | |
| } | |
| }, | |
| { | |
| "rank": 27, | |
| "name": "Solomon v1.1", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "head / adapter", | |
| "index": 36.43, | |
| "areas": { | |
| "knowledge": 0.2213, | |
| "language": 0.5728, | |
| "retrieval": 0.2597, | |
| "tools": 0.4697, | |
| "arts": 0.2116 | |
| } | |
| }, | |
| { | |
| "rank": 28, | |
| "name": "Kev 4B", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "LoRA + head", | |
| "index": 34.64, | |
| "areas": { | |
| "knowledge": 0.2286, | |
| "language": 0.353, | |
| "retrieval": 0.4098, | |
| "tools": 0.5256, | |
| "arts": 0.1792 | |
| } | |
| }, | |
| { | |
| "rank": 29, | |
| "name": "Decision 1.0 Nox", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "head / adapter", | |
| "index": 34.36, | |
| "areas": { | |
| "knowledge": 0.2141, | |
| "language": 0.3659, | |
| "retrieval": 0.4431, | |
| "tools": 0.4957, | |
| "arts": 0.1439 | |
| } | |
| }, | |
| { | |
| "rank": 30, | |
| "name": "Jobe", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "inference technique", | |
| "index": 32.35, | |
| "areas": { | |
| "knowledge": 0.1773, | |
| "language": 0.3454, | |
| "retrieval": 0.3669, | |
| "tools": 0.4881, | |
| "arts": 0.2574 | |
| } | |
| }, | |
| { | |
| "rank": 31, | |
| "name": "mmastrac diffusiongemma (vLLM PR 57250)", | |
| "size_b": 26.0, | |
| "base_model": "google/diffusiongemma-26B-A4B-it", | |
| "kind": "inference technique", | |
| "index": 32.24, | |
| "areas": { | |
| "knowledge": 0.249, | |
| "language": 0.4593, | |
| "retrieval": 0.2417, | |
| "tools": 0.3399, | |
| "arts": 0.2881 | |
| } | |
| }, | |
| { | |
| "rank": 32, | |
| "name": "open-jev (pngwn)", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "LoRA", | |
| "index": 29.91, | |
| "areas": { | |
| "knowledge": 0.1988, | |
| "language": 0.3546, | |
| "retrieval": 0.2912, | |
| "tools": 0.4573, | |
| "arts": 0.1414 | |
| } | |
| }, | |
| { | |
| "rank": 33, | |
| "name": "Tev1-4B-experimental", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "full fine-tune", | |
| "index": 29.24, | |
| "areas": { | |
| "knowledge": 0.2349, | |
| "language": 0.3919, | |
| "retrieval": 0.1548, | |
| "tools": 0.4183, | |
| "arts": 0.2292 | |
| } | |
| }, | |
| { | |
| "rank": 34, | |
| "name": "Decider 2B", | |
| "size_b": 2.0, | |
| "base_model": "Qwen/Qwen3.5-2B-Base", | |
| "kind": "full fine-tune", | |
| "index": 28.97, | |
| "areas": { | |
| "knowledge": 0.1493, | |
| "language": 0.3257, | |
| "retrieval": 0.3729, | |
| "tools": 0.4245, | |
| "arts": 0.1464 | |
| } | |
| }, | |
| { | |
| "rank": 35, | |
| "name": "openvons", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3-4B-Instruct-2507", | |
| "kind": "inference technique", | |
| "index": 28.42, | |
| "areas": { | |
| "knowledge": 0.2077, | |
| "language": 0.301, | |
| "retrieval": 0.2537, | |
| "tools": 0.4465, | |
| "arts": 0.2033 | |
| } | |
| }, | |
| { | |
| "rank": 36, | |
| "name": "this-that 1.2", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 28.14, | |
| "areas": { | |
| "knowledge": 0.1514, | |
| "language": 0.3191, | |
| "retrieval": 0.3283, | |
| "tools": 0.4497, | |
| "arts": 0.1183 | |
| } | |
| }, | |
| { | |
| "rank": 37, | |
| "name": "Metask-Jev-4B", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "LoRA", | |
| "index": 26.89, | |
| "areas": { | |
| "knowledge": 0.2096, | |
| "language": 0.3939, | |
| "retrieval": 0.1291, | |
| "tools": 0.3759, | |
| "arts": 0.1828 | |
| } | |
| }, | |
| { | |
| "rank": 38, | |
| "name": "SemIf", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3.5-4B-Base", | |
| "kind": "inference technique", | |
| "index": 25.94, | |
| "areas": { | |
| "knowledge": 0.171, | |
| "language": 0.3379, | |
| "retrieval": 0.1572, | |
| "tools": 0.391, | |
| "arts": 0.2492 | |
| } | |
| }, | |
| { | |
| "rank": 39, | |
| "name": "Decision 1.0 Sol", | |
| "size_b": 2.0, | |
| "base_model": "Qwen/Qwen3.5-2B-Base", | |
| "kind": "head / adapter", | |
| "index": 25.32, | |
| "areas": { | |
| "knowledge": 0.1149, | |
| "language": 0.2535, | |
| "retrieval": 0.3271, | |
| "tools": 0.4611, | |
| "arts": 0.0818 | |
| } | |
| }, | |
| { | |
| "rank": 40, | |
| "name": "mini-jev", | |
| "size_b": 4.0, | |
| "base_model": "Qwen/Qwen3-4B-Instruct-2507", | |
| "kind": "inference technique", | |
| "index": 20.98, | |
| "areas": { | |
| "knowledge": 0.1763, | |
| "language": 0.2857, | |
| "retrieval": 0.0866, | |
| "tools": 0.2842, | |
| "arts": 0.2107 | |
| } | |
| }, | |
| { | |
| "rank": 41, | |
| "name": "Bosun v3.1 1.7B", | |
| "size_b": 1.7, | |
| "base_model": "Qwen/Qwen3-1.7B-Base", | |
| "kind": "LoRA + head", | |
| "index": 20.1, | |
| "areas": { | |
| "knowledge": 0.0472, | |
| "language": 0.124, | |
| "retrieval": 0.4282, | |
| "tools": 0.3478, | |
| "arts": 0.0747 | |
| } | |
| }, | |
| { | |
| "rank": 42, | |
| "name": "Intern-Decision-2B", | |
| "size_b": 2.0, | |
| "base_model": "Qwen/Qwen3.5-2B-Base", | |
| "kind": "full fine-tune", | |
| "index": 19.38, | |
| "areas": { | |
| "knowledge": 0.138, | |
| "language": 0.2056, | |
| "retrieval": 0.1566, | |
| "tools": 0.3334, | |
| "arts": 0.1272 | |
| } | |
| }, | |
| { | |
| "rank": 43, | |
| "name": "JPT-0.8B", | |
| "size_b": 0.8, | |
| "base_model": "Qwen/Qwen3.5-0.8B-Base", | |
| "kind": "LoRA", | |
| "index": 19.22, | |
| "areas": { | |
| "knowledge": 0.0988, | |
| "language": 0.2304, | |
| "retrieval": 0.164, | |
| "tools": 0.3623, | |
| "arts": 0.08 | |
| } | |
| }, | |
| { | |
| "rank": 44, | |
| "name": "Decision 1.0 Eos", | |
| "size_b": 0.8, | |
| "base_model": "Qwen/Qwen3.5-0.8B-Base", | |
| "kind": "head / adapter", | |
| "index": 18.41, | |
| "areas": { | |
| "knowledge": 0.0737, | |
| "language": 0.1459, | |
| "retrieval": 0.3057, | |
| "tools": 0.321, | |
| "arts": 0.0747 | |
| } | |
| }, | |
| { | |
| "rank": 45, | |
| "name": "Kev 0.8B", | |
| "size_b": 0.8, | |
| "base_model": "Qwen/Qwen3.5-0.8B-Base", | |
| "kind": "LoRA + head", | |
| "index": 14.6, | |
| "areas": { | |
| "knowledge": 0.0608, | |
| "language": 0.1133, | |
| "retrieval": 0.1914, | |
| "tools": 0.315, | |
| "arts": 0.0511 | |
| } | |
| }, | |
| { | |
| "rank": 46, | |
| "name": "Bosun v3.1 0.6B", | |
| "size_b": 0.6, | |
| "base_model": "Qwen/Qwen3-0.6B-Base", | |
| "kind": "LoRA + head", | |
| "index": 14.32, | |
| "areas": { | |
| "knowledge": 0.0283, | |
| "language": 0.0383, | |
| "retrieval": 0.3415, | |
| "tools": 0.2844, | |
| "arts": 0.0557 | |
| } | |
| }, | |
| { | |
| "rank": 47, | |
| "name": "Tev1-0.8B-experimental", | |
| "size_b": 0.8, | |
| "base_model": "Qwen/Qwen3.5-0.8B-Base", | |
| "kind": "full fine-tune", | |
| "index": 12.85, | |
| "areas": { | |
| "knowledge": 0.0729, | |
| "language": 0.1405, | |
| "retrieval": 0.0488, | |
| "tools": 0.3197, | |
| "arts": 0.0512 | |
| } | |
| }, | |
| { | |
| "rank": 48, | |
| "name": "Intern-Decision-0.8B", | |
| "size_b": 0.8, | |
| "base_model": "Qwen/Qwen3.5-0.8B-Base", | |
| "kind": "full fine-tune", | |
| "index": 11.94, | |
| "areas": { | |
| "knowledge": 0.0797, | |
| "language": 0.1035, | |
| "retrieval": 0.0644, | |
| "tools": 0.2838, | |
| "arts": 0.0722 | |
| } | |
| }, | |
| { | |
| "rank": 49, | |
| "name": "MoJev", | |
| "size_b": 0.8, | |
| "base_model": "Qwen/Qwen3.5-0.8B-Base", | |
| "kind": "head / adapter", | |
| "index": 11.69, | |
| "areas": { | |
| "knowledge": 0.0557, | |
| "language": 0.0908, | |
| "retrieval": 0.1618, | |
| "tools": 0.2186, | |
| "arts": 0.0672 | |
| } | |
| }, | |
| { | |
| "rank": 50, | |
| "name": "GLiNER2.5-Decide", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 11.21, | |
| "areas": { | |
| "knowledge": 0.0241, | |
| "language": 0.0748, | |
| "retrieval": 0.2532, | |
| "tools": 0.1478, | |
| "arts": 0.0887 | |
| } | |
| }, | |
| { | |
| "rank": 51, | |
| "name": "Lavoir", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 8.69, | |
| "areas": { | |
| "knowledge": 0.0349, | |
| "language": 0.1037, | |
| "retrieval": 0.12, | |
| "tools": 0.1302, | |
| "arts": 0.0323 | |
| } | |
| }, | |
| { | |
| "rank": 52, | |
| "name": "jeff", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "inference technique", | |
| "index": 8.04, | |
| "areas": { | |
| "knowledge": 0.0305, | |
| "language": 0.104, | |
| "retrieval": 0.2131, | |
| "tools": 0.0119, | |
| "arts": 0.0077 | |
| } | |
| }, | |
| { | |
| "rank": 53, | |
| "name": "CLM-v0.1-8B", | |
| "size_b": 8.0, | |
| "base_model": "Qwen/Qwen3-8B-Base", | |
| "kind": "full fine-tune", | |
| "index": 7.4, | |
| "areas": { | |
| "knowledge": 0.0311, | |
| "language": 0.0523, | |
| "retrieval": 0.1126, | |
| "tools": 0.1398, | |
| "arts": 0.043 | |
| } | |
| }, | |
| { | |
| "rank": 54, | |
| "name": "GLiNER 2.5 base", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 6.76, | |
| "areas": { | |
| "knowledge": 0.021, | |
| "language": 0.0748, | |
| "retrieval": 0.0966, | |
| "tools": 0.1116, | |
| "arts": 0.0313 | |
| } | |
| }, | |
| { | |
| "rank": 55, | |
| "name": "LFM2.5-2.6B-RLCD", | |
| "size_b": 2.6, | |
| "base_model": "LiquidAI/LFM2.5-2.6B-Base", | |
| "kind": "full fine-tune", | |
| "index": 6.76, | |
| "areas": { | |
| "knowledge": 0.0742, | |
| "language": 0.0542, | |
| "retrieval": 0.1053, | |
| "tools": 0.0443, | |
| "arts": 0.0525 | |
| } | |
| }, | |
| { | |
| "rank": 56, | |
| "name": "Decision 1.0 Kai", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "head / adapter", | |
| "index": 6.52, | |
| "areas": { | |
| "knowledge": 0.0383, | |
| "language": 0.0291, | |
| "retrieval": 0.0932, | |
| "tools": 0.1423, | |
| "arts": 0.0308 | |
| } | |
| }, | |
| { | |
| "rank": 57, | |
| "name": "Laya", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 6.04, | |
| "areas": { | |
| "knowledge": 0.0356, | |
| "language": 0.0903, | |
| "retrieval": 0.0715, | |
| "tools": 0.0582, | |
| "arts": 0.0289 | |
| } | |
| }, | |
| { | |
| "rank": 58, | |
| "name": "Julia 1", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 5.54, | |
| "areas": { | |
| "knowledge": 0.0661, | |
| "language": 0.0139, | |
| "retrieval": 0.0991, | |
| "tools": 0.072, | |
| "arts": 0.0174 | |
| } | |
| }, | |
| { | |
| "rank": 59, | |
| "name": "system-one-gemma", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "LoRA + head", | |
| "index": 5.07, | |
| "areas": { | |
| "knowledge": 0.0129, | |
| "language": 0.0108, | |
| "retrieval": 0.1722, | |
| "tools": 0.0331, | |
| "arts": 0.0408 | |
| } | |
| }, | |
| { | |
| "rank": 60, | |
| "name": "Decision 1.0 Lex", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "head / adapter", | |
| "index": 4.54, | |
| "areas": { | |
| "knowledge": 0.0188, | |
| "language": 0.0241, | |
| "retrieval": 0.0625, | |
| "tools": 0.1086, | |
| "arts": 0.0193 | |
| } | |
| }, | |
| { | |
| "rank": 61, | |
| "name": "GLiNER 2.5 multilingual", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 4.26, | |
| "areas": { | |
| "knowledge": 0.009, | |
| "language": 0.0636, | |
| "retrieval": 0.0531, | |
| "tools": 0.0587, | |
| "arts": 0.025 | |
| } | |
| }, | |
| { | |
| "rank": 62, | |
| "name": "GLiNER 2.5 small", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 3.82, | |
| "areas": { | |
| "knowledge": 0.0175, | |
| "language": 0.0375, | |
| "retrieval": 0.043, | |
| "tools": 0.0698, | |
| "arts": 0.0266 | |
| } | |
| }, | |
| { | |
| "rank": 63, | |
| "name": "Qwen-2.5-1B-RLCD", | |
| "size_b": 1.5, | |
| "base_model": "Qwen/Qwen2.5-1.5B", | |
| "kind": "inference technique", | |
| "index": 3.78, | |
| "areas": { | |
| "knowledge": 0.014, | |
| "language": 0.0471, | |
| "retrieval": 0.0094, | |
| "tools": 0.07, | |
| "arts": 0.0731 | |
| } | |
| }, | |
| { | |
| "rank": 64, | |
| "name": "Lumma-Fev-0.6B", | |
| "size_b": 0.6, | |
| "base_model": "FrontiersMind/Lumma-0.6B-Base", | |
| "kind": "LoRA", | |
| "index": 2.97, | |
| "areas": { | |
| "knowledge": 0.0234, | |
| "language": 0.0091, | |
| "retrieval": 0.0888, | |
| "tools": 0.0112, | |
| "arts": 0.0144 | |
| } | |
| }, | |
| { | |
| "rank": 65, | |
| "name": "Verdict", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 1.87, | |
| "areas": { | |
| "knowledge": 0.0036, | |
| "language": 0.0145, | |
| "retrieval": 0.0, | |
| "tools": 0.0658, | |
| "arts": 0.0203 | |
| } | |
| }, | |
| { | |
| "rank": 66, | |
| "name": "Lumma-Fev-0.1B", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 1.78, | |
| "areas": { | |
| "knowledge": 0.0151, | |
| "language": 0.0062, | |
| "retrieval": 0.0245, | |
| "tools": 0.0265, | |
| "arts": 0.0257 | |
| } | |
| }, | |
| { | |
| "rank": 67, | |
| "name": "LFM2.5-350M-RLCD", | |
| "size_b": null, | |
| "base_model": null, | |
| "kind": "full fine-tune", | |
| "index": 1.38, | |
| "areas": { | |
| "knowledge": 0.0047, | |
| "language": 0.0098, | |
| "retrieval": 0.0002, | |
| "tools": 0.0384, | |
| "arts": 0.0298 | |
| } | |
| } | |
| ] | |
| }, | |
| "wald_di": [ | |
| { | |
| "id": "v1.0", | |
| "label": "Wald-4B v1.0 \u00b7 effort medium", | |
| "size_b": 4.0, | |
| "index": 53.91, | |
| "ci95": [ | |
| 51.87, | |
| 55.27 | |
| ], | |
| "areas": { | |
| "knowledge": 0.3945, | |
| "language": 0.6176, | |
| "retrieval": 0.5193, | |
| "tools": 0.782, | |
| "arts": 0.3058 | |
| }, | |
| "source": "results/decision-index/boot021-0927-021A0-f10.json#arrmed", | |
| "status": "committed" | |
| } | |
| ], | |
| "effort_di": { | |
| "none": { | |
| "index": 42.89, | |
| "ci95": [ | |
| 41.16, | |
| 44.43 | |
| ], | |
| "areas": { | |
| "knowledge": 0.2859, | |
| "language": 0.448, | |
| "retrieval": 0.463, | |
| "tools": 0.6369, | |
| "arts": 0.3011 | |
| }, | |
| "source": "results/decision-index/boot021-0927-015G0-f4.json#g4one" | |
| }, | |
| "low": { | |
| "index": 45.23, | |
| "ci95": [ | |
| 43.54, | |
| 46.69 | |
| ], | |
| "areas": { | |
| "knowledge": 0.3545, | |
| "language": 0.4672, | |
| "retrieval": 0.4676, | |
| "tools": 0.6355, | |
| "arts": 0.3011 | |
| }, | |
| "source": "results/decision-index/boot021-0927-015G0-f4.json#g4low" | |
| }, | |
| "medium": { | |
| "index": 47.23, | |
| "ci95": [ | |
| 45.52, | |
| 48.86 | |
| ], | |
| "areas": { | |
| "knowledge": 0.3998, | |
| "language": 0.5023, | |
| "retrieval": 0.4671, | |
| "tools": 0.642, | |
| "arts": 0.2819 | |
| }, | |
| "source": "results/decision-index/boot021-0927-015G0-f4.json#g4med" | |
| }, | |
| "high": { | |
| "index": 49.14, | |
| "ci95": [ | |
| 47.21, | |
| 50.65 | |
| ], | |
| "areas": { | |
| "knowledge": 0.4415, | |
| "language": 0.5279, | |
| "retrieval": 0.4698, | |
| "tools": 0.6605, | |
| "arts": 0.2604 | |
| }, | |
| "source": "results/decision-index/boot021-0927-015G0-f4.json#g4high" | |
| }, | |
| "high-k4": { | |
| "index": 49.62, | |
| "ci95": [ | |
| 47.95, | |
| 51.16 | |
| ], | |
| "areas": { | |
| "knowledge": 0.4649, | |
| "language": 0.5232, | |
| "retrieval": 0.4698, | |
| "tools": 0.6605, | |
| "arts": 0.2604 | |
| }, | |
| "source": "results/decision-index/boot021-0927-015G0-f4.json#g4k4" | |
| } | |
| }, | |
| "qwen27_paren": { | |
| "index": 47.78, | |
| "ci95": [ | |
| 45.95, | |
| 49.17 | |
| ], | |
| "areas": { | |
| "knowledge": 0.3485, | |
| "language": 0.4867, | |
| "retrieval": 0.557, | |
| "tools": 0.6954, | |
| "arts": 0.2329 | |
| }, | |
| "source": "results/decision-index/boot021-bigbase-0927.json#q27paren" | |
| }, | |
| "jev_sample": { | |
| "index": 57.19, | |
| "ci95": [ | |
| 55.29, | |
| 58.6 | |
| ], | |
| "areas": { | |
| "knowledge": 0.5044, | |
| "language": 0.5832, | |
| "retrieval": 0.566, | |
| "tools": 0.763, | |
| "arts": 0.3799 | |
| }, | |
| "source": "results/decision-index/boot021-0927.json#jev" | |
| }, | |
| "board_named": { | |
| "decider_4b": { | |
| "rank": 15, | |
| "index": 40.7, | |
| "base_model": "Qwen/Qwen3.5-4B-Base" | |
| }, | |
| "decider_35b": { | |
| "rank": 11, | |
| "index": 47.11, | |
| "base_model": "Qwen/Qwen3.5-35B-A3B-Base" | |
| } | |
| }, | |
| "board_4_5": [ | |
| { | |
| "rank": 4, | |
| "name": "simple-jev \u00b7 Qwen3.8-27B (featherless)", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "inference technique", | |
| "index": 55.74, | |
| "areas": { | |
| "knowledge": 0.3656, | |
| "language": 0.6209, | |
| "retrieval": 0.6325, | |
| "tools": 0.7621, | |
| "arts": 0.3648 | |
| } | |
| }, | |
| { | |
| "rank": 5, | |
| "name": "Jebadiah 27B", | |
| "size_b": 27.0, | |
| "base_model": "Qwen/Qwen3.8-27B", | |
| "kind": "LoRA", | |
| "index": 54.67, | |
| "areas": { | |
| "knowledge": 0.3884, | |
| "language": 0.6068, | |
| "retrieval": 0.5389, | |
| "tools": 0.7813, | |
| "arts": 0.3873 | |
| } | |
| } | |
| ], | |
| "verticals": [ | |
| { | |
| "laya_0shot": 35.6, | |
| "laya_p50_ms": 893.8, | |
| "clm_0shot": 34.8, | |
| "clm_p50_ms": 1059.5, | |
| "task": "When2Call", | |
| "metric": "accuracy", | |
| "n_test": 500, | |
| "ours_lora": 82.8, | |
| "ours_ci95": [ | |
| 79.2, | |
| 86.0 | |
| ], | |
| "jev": 72.6, | |
| "wald_0shot": 68.6, | |
| "raw_qwen_0shot": 47.4, | |
| "raw_source": "verticals/when2call/runs/20260926-2141/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 6.2, | |
| 14.2 | |
| ], | |
| "train_usd": 1.0, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": 33.9, | |
| "laya_p50_ms": 897.7, | |
| "clm_0shot": 0.3, | |
| "clm_p50_ms": 1057.1, | |
| "task": "BANKING77", | |
| "metric": "macro-F1", | |
| "n_test": 500, | |
| "ours_lora": 92.8, | |
| "ours_ci95": [ | |
| 89.5, | |
| 94.6 | |
| ], | |
| "jev": 78.1, | |
| "wald_0shot": 77.4, | |
| "raw_qwen_0shot": 66.8, | |
| "raw_source": "verticals/banking77/runs/20260926-2200/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 12.1, | |
| 18.6 | |
| ], | |
| "train_usd": 0.64, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": 62.6, | |
| "laya_p50_ms": 992.6, | |
| "clm_0shot": 12.7, | |
| "clm_p50_ms": 1064.2, | |
| "task": "SGD intent", | |
| "metric": "macro-F1", | |
| "n_test": 500, | |
| "ours_lora": 98.0, | |
| "ours_ci95": [ | |
| 92.6, | |
| 99.2 | |
| ], | |
| "jev": 92.8, | |
| "wald_0shot": 82.8, | |
| "raw_qwen_0shot": 79.7, | |
| "raw_source": "verticals/sgd-intent/runs/20260926-2227/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 2.9, | |
| 8.2 | |
| ], | |
| "train_usd": 0.83, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": 14.2, | |
| "laya_p50_ms": 271.4, | |
| "clm_0shot": 12.9, | |
| "clm_p50_ms": 88.2, | |
| "task": "ToxicChat", | |
| "metric": "toxic-class F1", | |
| "n_test": 5029, | |
| "ours_lora": 84.9, | |
| "ours_ci95": [ | |
| 81.9, | |
| 87.6 | |
| ], | |
| "jev": 80.4, | |
| "wald_0shot": 73.4, | |
| "raw_qwen_0shot": 36.2, | |
| "raw_source": "verticals/toxicchat/runs/20260927-0045/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 1.5, | |
| 7.5 | |
| ], | |
| "train_usd": 0.2, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": null, | |
| "laya_p50_ms": null, | |
| "clm_0shot": 34.0, | |
| "clm_p50_ms": 1064.9, | |
| "task": "MetaTool", | |
| "metric": "accuracy", | |
| "n_test": 500, | |
| "ours_lora": 97.0, | |
| "ours_ci95": [ | |
| 95.4, | |
| 98.4 | |
| ], | |
| "jev": 83.0, | |
| "wald_0shot": 80.4, | |
| "raw_qwen_0shot": 75.8, | |
| "raw_source": "verticals/metatool/runs/20260927-0228/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 10.8, | |
| 17.2 | |
| ], | |
| "train_usd": 0.79, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": null, | |
| "laya_p50_ms": null, | |
| "clm_0shot": 61.2, | |
| "clm_p50_ms": 1066.2, | |
| "task": "AndroidControl", | |
| "metric": "accuracy", | |
| "n_test": 500, | |
| "ours_lora": 81.6, | |
| "ours_ci95": [ | |
| 78.0, | |
| 85.0 | |
| ], | |
| "jev": 73.4, | |
| "wald_0shot": 60.6, | |
| "raw_qwen_0shot": 62.0, | |
| "raw_source": "verticals/androidcontrol/runs/20260927-0245/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 4.4, | |
| 12.4 | |
| ], | |
| "train_usd": 1.48, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": 25.6, | |
| "laya_p50_ms": 992.6, | |
| "clm_0shot": 0.0, | |
| "clm_p50_ms": 1062.2, | |
| "task": "RouteLLM routing", | |
| "metric": "needs-strong F1", | |
| "n_test": 500, | |
| "ours_lora": 26.8, | |
| "ours_ci95": [ | |
| 18.3, | |
| 35.4 | |
| ], | |
| "jev": 0.0, | |
| "wald_0shot": 11.3, | |
| "raw_qwen_0shot": 33.3, | |
| "raw_source": "verticals/model-routing/runs/20260927-0236/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 18.3, | |
| 35.4 | |
| ], | |
| "train_usd": 0.63, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": 13.3, | |
| "laya_p50_ms": 250.0, | |
| "clm_0shot": 61.7, | |
| "clm_p50_ms": 266.9, | |
| "task": "Agent-trajectory safety (hard)", | |
| "metric": "unsafe-class F1", | |
| "n_test": 500, | |
| "ours_lora": 72.2, | |
| "ours_ci95": [ | |
| 68.0, | |
| 75.9 | |
| ], | |
| "jev": 47.0, | |
| "wald_0shot": 32.5, | |
| "raw_qwen_0shot": 70.1, | |
| "raw_source": "verticals/agent-trajectory-safety-hard/runs/20260927-0259/report.json", | |
| "ours_minus_jev_ci95": [ | |
| 18.3, | |
| 32.2 | |
| ], | |
| "train_usd": 0.15, | |
| "beats_jev": true | |
| }, | |
| { | |
| "laya_0shot": 2.1, | |
| "laya_p50_ms": 1020.9, | |
| "clm_0shot": 3.8, | |
| "clm_p50_ms": 1383.2, | |
| "task": "Mind2Web", | |
| "metric": "accuracy", | |
| "n_test": 480, | |
| "ours_lora": 51.9, | |
| "ours_ci95": [ | |
| 47.3, | |
| 56.0 | |
| ], | |
| "jev": 48.5, | |
| "wald_0shot": 32.3, | |
| "raw_qwen_0shot": 9.8, | |
| "raw_source": "verticals/mind2web/runs/20260927-0119/report.json", | |
| "ours_minus_jev_ci95": [ | |
| -1.2, | |
| 7.9 | |
| ], | |
| "train_usd": 1.81, | |
| "beats_jev": false | |
| }, | |
| { | |
| "laya_0shot": 56.6, | |
| "laya_p50_ms": 220.6, | |
| "clm_0shot": 30.6, | |
| "clm_p50_ms": 1021.4, | |
| "task": "Prompt injection", | |
| "metric": "injection-class F1", | |
| "n_test": 578, | |
| "ours_lora": 79.4, | |
| "ours_ci95": [ | |
| 73.5, | |
| 84.5 | |
| ], | |
| "jev": 82.8, | |
| "wald_0shot": 71.3, | |
| "raw_qwen_0shot": 31.6, | |
| "raw_source": "verticals/prompt-injection/runs/20260927-0238/report.json", | |
| "ours_minus_jev_ci95": [ | |
| -10.1, | |
| 3.1 | |
| ], | |
| "train_usd": 0.12, | |
| "beats_jev": false | |
| }, | |
| { | |
| "laya_0shot": 49.2, | |
| "laya_p50_ms": 547.9, | |
| "clm_0shot": 50.3, | |
| "clm_p50_ms": 602.6, | |
| "task": "RewardBench", | |
| "metric": "accuracy", | |
| "n_test": 1000, | |
| "ours_lora": 83.4, | |
| "ours_ci95": [ | |
| 81.0, | |
| 85.7 | |
| ], | |
| "jev": 90.6, | |
| "wald_0shot": 83.7, | |
| "raw_qwen_0shot": 65.0, | |
| "raw_source": "verticals/rewardbench/runs/20260927-0048/report.json", | |
| "ours_minus_jev_ci95": [ | |
| -9.4, | |
| -5.1 | |
| ], | |
| "train_usd": 1.49, | |
| "beats_jev": false | |
| }, | |
| { | |
| "task": "COLD (Chinese)", | |
| "metric": "macro-F1", | |
| "n_test": 5323, | |
| "ours_lora": 84.1, | |
| "ours_ci95": [ | |
| 83.2, | |
| 85.1 | |
| ], | |
| "jev": 75.3, | |
| "wald_0shot": 80.1, | |
| "raw_qwen_0shot": null, | |
| "raw_source": null, | |
| "laya_0shot": null, | |
| "laya_p50_ms": null, | |
| "clm_0shot": null, | |
| "clm_p50_ms": null, | |
| "ours_minus_jev_ci95": [ | |
| 7.7, | |
| 10.0 | |
| ], | |
| "train_usd": 1.0, | |
| "beats_jev": true, | |
| "note": "LoRA on all 25,382 train labels averaged with the zero-shot base; ties the best published 83.7" | |
| } | |
| ], | |
| "suite": [ | |
| { | |
| "system": "Wald-4B v1.0 \u00b7 medium (packaged server)", | |
| "public231": 88.3, | |
| "xl_hidden": 63.2, | |
| "source": "public 231: packaged wald-serve smoke read of 021A0-f10 09-27 (ledger 197); XL: xl-bench leaderboard.md (hidden split)" | |
| }, | |
| { | |
| "system": "Jev (API, jev-1.13.0)", | |
| "public231": 86.6, | |
| "xl_hidden": 73.0, | |
| "source": "results/external/jev-1.13.0; xl-bench #1" | |
| }, | |
| { | |
| "system": "Cygnet (gemma-4-12B-it + shim)", | |
| "public231": null, | |
| "xl_hidden": 59.8, | |
| "source": "xl-bench #4" | |
| }, | |
| { | |
| "system": "Laya (zero-shot, Jev's wire request)", | |
| "public231": 58.0, | |
| "xl_hidden": 13.4, | |
| "source": "results/external/laya; xl-bench #24" | |
| }, | |
| { | |
| "system": "CLM-8B (zero-shot, same requests, deployment verified)", | |
| "public231": 39.0, | |
| "xl_hidden": 12.7, | |
| "source": "ledger 190 read (results/external/clm-8b); xl-bench #25" | |
| }, | |
| { | |
| "system": "raw Qwen3.5-4B-Base (zero-shot, our readout)", | |
| "public231": 67.5, | |
| "xl_hidden": null, | |
| "source": "exported lineage summary (public one-pass 156 / 231)" | |
| } | |
| ], | |
| "effort_serving": [ | |
| { | |
| "effort": "none", | |
| "thinks": 0.0, | |
| "public231": 194, | |
| "xl_dev": 72.4, | |
| "processbench": 64.2, | |
| "p50_s": 0.051, | |
| "p95_s": 0.117, | |
| "usd_per_1k": 0.0184 | |
| }, | |
| { | |
| "effort": "low", | |
| "thinks": 1.2, | |
| "public231": 192, | |
| "xl_dev": 76.0, | |
| "processbench": 64.2, | |
| "p50_s": 0.048, | |
| "p95_s": 0.109, | |
| "usd_per_1k": 0.0194 | |
| }, | |
| { | |
| "effort": "medium", | |
| "thinks": 11.0, | |
| "public231": 202, | |
| "xl_dev": 81.1, | |
| "processbench": 66.7, | |
| "p50_s": 0.052, | |
| "p95_s": 1.08, | |
| "usd_per_1k": 0.0234 | |
| }, | |
| { | |
| "effort": "high", | |
| "thinks": 100.0, | |
| "public231": 194, | |
| "xl_dev": 85.8, | |
| "processbench": 83.4, | |
| "p50_s": 0.62, | |
| "p95_s": 1.7, | |
| "usd_per_1k": 0.0366 | |
| } | |
| ], | |
| "reference_api": { | |
| "name": "Jev API", | |
| "p50_s": 0.4, | |
| "p95_s": 0.83, | |
| "usd_per_1k": 0.04 | |
| }, | |
| "serving": { | |
| "rtxpro6000_fp8_usd_per_1k": 0.0073, | |
| "rtxpro6000_fp8_decisions_per_s": 114.9, | |
| "rtxpro6000_c1_p50_ms": 26, | |
| "multitenant_c32_usd_per_1k": 0.0067, | |
| "multitenant_c32_decisions_per_s": 70, | |
| "vertical_when2call_p50_ms": 56, | |
| "vertical_banking77_p50_ms": 176, | |
| "jev_when2call_p50_ms": 541, | |
| "jev_banking77_p50_ms": 702, | |
| "jev_usd_per_1k": 0.04 | |
| } | |
| } | |