Instructions to use k050506koch/GPT3-dev-125m-0612 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use k050506koch/GPT3-dev-125m-0612 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="k050506koch/GPT3-dev-125m-0612", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("k050506koch/GPT3-dev-125m-0612", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use k050506koch/GPT3-dev-125m-0612 with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf k050506koch/GPT3-dev-125m-0612 # Run inference directly in the terminal: llama cli -hf k050506koch/GPT3-dev-125m-0612
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf k050506koch/GPT3-dev-125m-0612 # Run inference directly in the terminal: llama cli -hf k050506koch/GPT3-dev-125m-0612
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf k050506koch/GPT3-dev-125m-0612 # Run inference directly in the terminal: ./llama-cli -hf k050506koch/GPT3-dev-125m-0612
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf k050506koch/GPT3-dev-125m-0612 # Run inference directly in the terminal: ./build/bin/llama-cli -hf k050506koch/GPT3-dev-125m-0612
Use Docker
docker model run hf.co/k050506koch/GPT3-dev-125m-0612
- LM Studio
- Jan
- vLLM
How to use k050506koch/GPT3-dev-125m-0612 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "k050506koch/GPT3-dev-125m-0612" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "k050506koch/GPT3-dev-125m-0612", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/k050506koch/GPT3-dev-125m-0612
- SGLang
How to use k050506koch/GPT3-dev-125m-0612 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "k050506koch/GPT3-dev-125m-0612" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "k050506koch/GPT3-dev-125m-0612", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "k050506koch/GPT3-dev-125m-0612" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "k050506koch/GPT3-dev-125m-0612", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Ollama
How to use k050506koch/GPT3-dev-125m-0612 with Ollama:
ollama run hf.co/k050506koch/GPT3-dev-125m-0612
- Unsloth Desktop
- Docker Model Runner
How to use k050506koch/GPT3-dev-125m-0612 with Docker Model Runner:
docker model run hf.co/k050506koch/GPT3-dev-125m-0612
- Lemonade
How to use k050506koch/GPT3-dev-125m-0612 with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull k050506koch/GPT3-dev-125m-0612
Run and chat with the model
lemonade run user.GPT3-dev-125m-0612-{{QUANT_TAG}}List all available models
lemonade list
- Atomic Chat
Added model forward compatibility with transformers>=5.5.3
Browse files- modeling_gpt3dev.py +70 -0
modeling_gpt3dev.py
CHANGED
|
@@ -408,3 +408,73 @@ class GPT3DevLMHeadModel(GPT2LMHeadModel):
|
|
| 408 |
AutoConfig.register("gpt3dev", GPT3DevConfig)
|
| 409 |
AutoModel.register(GPT3DevConfig, GPT3DevModel)
|
| 410 |
AutoModelForCausalLM.register(GPT3DevConfig, GPT3DevLMHeadModel)
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 408 |
AutoConfig.register("gpt3dev", GPT3DevConfig)
|
| 409 |
AutoModel.register(GPT3DevConfig, GPT3DevModel)
|
| 410 |
AutoModelForCausalLM.register(GPT3DevConfig, GPT3DevLMHeadModel)
|
| 411 |
+
|
| 412 |
+
# ---- Transformers 5.x compatibility patch ----
|
| 413 |
+
_ORIG_GPT3DEV_BLOCK_FORWARD = GPT3DevBlock.forward
|
| 414 |
+
_ORIG_GPT3DEV_SPARSE_FORWARD = GPT3DevSparseAttention.forward
|
| 415 |
+
|
| 416 |
+
def _patched_gpt3dev_block_forward(
|
| 417 |
+
self,
|
| 418 |
+
hidden_states,
|
| 419 |
+
past_key_values=None,
|
| 420 |
+
attention_mask=None,
|
| 421 |
+
encoder_hidden_states=None,
|
| 422 |
+
encoder_attention_mask=None,
|
| 423 |
+
use_cache=False,
|
| 424 |
+
**kwargs,
|
| 425 |
+
):
|
| 426 |
+
cache_position = kwargs.pop("cache_position", None)
|
| 427 |
+
output_attentions = kwargs.pop("output_attentions", False)
|
| 428 |
+
head_mask = kwargs.pop("head_mask", None)
|
| 429 |
+
past_key_value = kwargs.pop("past_key_value", None)
|
| 430 |
+
if past_key_values is None:
|
| 431 |
+
past_key_values = past_key_value
|
| 432 |
+
|
| 433 |
+
return _ORIG_GPT3DEV_BLOCK_FORWARD(
|
| 434 |
+
self,
|
| 435 |
+
hidden_states,
|
| 436 |
+
past_key_value=past_key_values,
|
| 437 |
+
cache_position=cache_position,
|
| 438 |
+
attention_mask=attention_mask,
|
| 439 |
+
head_mask=head_mask,
|
| 440 |
+
encoder_hidden_states=encoder_hidden_states,
|
| 441 |
+
encoder_attention_mask=encoder_attention_mask,
|
| 442 |
+
use_cache=use_cache,
|
| 443 |
+
output_attentions=output_attentions,
|
| 444 |
+
**kwargs,
|
| 445 |
+
)
|
| 446 |
+
|
| 447 |
+
|
| 448 |
+
def _patched_gpt3dev_sparse_forward(
|
| 449 |
+
self,
|
| 450 |
+
hidden_states,
|
| 451 |
+
past_key_values=None,
|
| 452 |
+
attention_mask=None,
|
| 453 |
+
encoder_hidden_states=None,
|
| 454 |
+
encoder_attention_mask=None,
|
| 455 |
+
output_attentions=False,
|
| 456 |
+
**kwargs,
|
| 457 |
+
):
|
| 458 |
+
cache_position = kwargs.pop("cache_position", None)
|
| 459 |
+
head_mask = kwargs.pop("head_mask", None)
|
| 460 |
+
past_key_value = kwargs.pop("past_key_value", None)
|
| 461 |
+
if past_key_values is None:
|
| 462 |
+
past_key_values = past_key_value
|
| 463 |
+
|
| 464 |
+
return _ORIG_GPT3DEV_SPARSE_FORWARD(
|
| 465 |
+
self,
|
| 466 |
+
hidden_states,
|
| 467 |
+
past_key_value=past_key_values,
|
| 468 |
+
cache_position=cache_position,
|
| 469 |
+
attention_mask=attention_mask,
|
| 470 |
+
head_mask=head_mask,
|
| 471 |
+
encoder_hidden_states=encoder_hidden_states,
|
| 472 |
+
encoder_attention_mask=encoder_attention_mask,
|
| 473 |
+
output_attentions=output_attentions,
|
| 474 |
+
**kwargs,
|
| 475 |
+
)
|
| 476 |
+
|
| 477 |
+
|
| 478 |
+
GPT3DevBlock.forward = _patched_gpt3dev_block_forward
|
| 479 |
+
GPT3DevSparseAttention.forward = _patched_gpt3dev_sparse_forward
|
| 480 |
+
# ---- End compatibility patch ----
|