#!/bin/bash # Online-Mind2Web held-out, reachable sites (96 tasks), live. Run inside finetune/isolated.sh (fresh browser profile, # every process and temp file removed afterwards). # CFG=fast laya alone CFG=s2 laya + System 2 when stuck / DONE rejected (+ DONE verification) # CFG=llm System 2 decides every step (the big model's own level in this harness) # LLM=sglang (Qwen3-8B-AWQ) | llama (Qwen3.6-35B-A3B GGUF) CK= cd /home/ckl/projects/S/laya && source env.sh O=finetune/out; I="bash finetune/infra.sh"; CK=${CK:-laya-browser-x5}; CFG=${CFG:-fast}; LLM=${LLM:-llama} export JEV_SAFE=1 OM2W_SITES=$PWD/$O/om2w_sites.json TAG=${CFG}_${LLM}_${CK} case $CFG in s2) export JEV_VERIFY_DONE=1 JEV_ESCALATE=1 ESCALATE_LOG=$PWD/$O/om2w_$TAG.escalations.jsonl;; llm) export JEV_VERIFY_DONE=1 ESCALATE_TAU=1.01 ESCALATE_LOG=$PWD/$O/om2w_$TAG.escalations.jsonl;; esac $I start_chrome >/dev/null if [ $LLM = llama ]; then $I start_llama >/dev/null; else SGL_MEM=0.5 $I start_sglang Qwen/Qwen3-8B-AWQ >/dev/null; fi until curl -sf -m 3 --noproxy '*' http://127.0.0.1:30000/health >/dev/null; do sleep 5; done $I start_s1 $PWD/$O/$CK 60 >/dev/null echo "== $TAG" (cd ../jev-ultrafast && .venv/bin/python ../laya/apps/browser_suite_om2w.py $PWD/../laya/$O/om2w_$TAG.jsonl) .venv/bin/python finetune/judge_om2w.py $O/om2w_$TAG.jsonl echo OM2W_DONE