File size: 2,600 Bytes
94cbe85
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
0bf2ff5
 
8a7af7a
0bf2ff5
e0be52c
 
94cbe85
 
 
 
 
 
 
 
 
 
 
 
0bf2ff5
 
 
 
 
 
 
 
94cbe85
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
FIGMENT_MODE=hosted
MODEL_STACK=omni_native
MODEL_BACKEND=
AUDIO_BACKEND=none
ENABLE_AUDIO_INTAKE=false
ALLOW_LOCAL_ASR=false
ALLOW_SELF_HOSTED_OMNI=false

HF_MODEL_ID=nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16
NVIDIA_MODEL_ID=nvidia/nemotron-3-nano-omni-30b-a3b-reasoning
NVIDIA_BASE_URL=https://integrate.api.nvidia.com/v1
NVIDIA_API_KEY=
LOCAL_MODEL_ID=nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16
HF_ENDPOINT_URL=
OMNI_ENDPOINT_URL=
HF_TOKEN=
LLAMA_BASE_URL=http://127.0.0.1:8001/v1
ZEROGPU_MODEL_REPO=build-small-hackathon/figment-finetuned-model-archive
ZEROGPU_MODEL_SUBFOLDER=figment_sft_v14p/figment-sft-v14p-lora-merged-bf16
ZEROGPU_DURATION_SECONDS=60
ZEROGPU_SIZE=large
ZEROGPU_MAX_CONTEXT_TOKENS=1536
ZEROGPU_MAX_GENERATION_TOKENS=512
FIGMENT_TRACE_DIR=traces
FIGMENT_SMOKE_ALLOW_NETWORK=false
FIGMENT_SMOKE_TIMEOUT_SECONDS=8
FIGMENT_SMOKE_TRACE_PATH=

# Hosted-live Omni demo:
# FIGMENT_MODE=hosted
# MODEL_BACKEND=hosted_omni
# NVIDIA_API_KEY=nvapi-...
# AUDIO_BACKEND=omni_native
# ENABLE_AUDIO_INTAKE=true

# Public HF ZeroGPU Space route for the published v14p model:
# FIGMENT_MODE=hosted
# MODEL_STACK=local_4b_parakeet
# MODEL_BACKEND=hf_zerogpu
# LOCAL_MODEL_ID=figment-sft-v14p-lora-merged-bf16
# AUDIO_BACKEND=none
# ENABLE_AUDIO_INTAKE=false

# Local/offline proof. This can use the smaller local model, or self-hosted Omni
# on adequate local hardware; smoke output records the configured LOCAL_MODEL_ID.
# FIGMENT_MODE=local
# MODEL_STACK=local_4b_parakeet
# MODEL_BACKEND=llama_cpp
# LLAMA_BASE_URL=http://127.0.0.1:8001/v1
# LOCAL_MODEL_ID=nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16
# AUDIO_BACKEND=none
# FIGMENT_SMOKE_ALLOW_NETWORK=true
#
# Evidence bundle after the full-weight local endpoint is live:
# PYTHON_DOTENV_DISABLED=true python3 scripts/run_local_4b_evidence.py --base-url "$LLAMA_BASE_URL"

# Self-hosted Omni proof on adequate local hardware. This is the technical
# Off the Grid Omni route when the endpoint is local and no cloud APIs are used.
# FIGMENT_MODE=local
# MODEL_STACK=omni_native
# MODEL_BACKEND=llama_cpp
# LOCAL_MODEL_ID=nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16
# LLAMA_BASE_URL=http://127.0.0.1:8001/v1
# ALLOW_SELF_HOSTED_OMNI=true

# Optional local ASR proof. Enable only after Parakeet local ASR passes the gate.
# MODEL_STACK=local_4b_parakeet
# MODEL_BACKEND=llama_cpp
# AUDIO_BACKEND=parakeet_nemo
# ENABLE_AUDIO_INTAKE=true
# ALLOW_LOCAL_ASR=true
# PYTHON_DOTENV_DISABLED=true python3 scripts/run_local_asr_evidence.py --provider-payload <local-parakeet-provider-output.json>

MODAL_PROFILE=
MISTRAL_API_KEY=
MINIMAX_API_KEY=