Text Generation
Transformers
TensorBoard
Safetensors
Portuguese
gpt2
Generated from Trainer
text-generation-inference
Instructions to use carlosdelfino/eli5_clm-model with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use carlosdelfino/eli5_clm-model with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="carlosdelfino/eli5_clm-model")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("carlosdelfino/eli5_clm-model") model = AutoModelForCausalLM.from_pretrained("carlosdelfino/eli5_clm-model", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use carlosdelfino/eli5_clm-model with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "carlosdelfino/eli5_clm-model" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "carlosdelfino/eli5_clm-model", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/carlosdelfino/eli5_clm-model
- SGLang
How to use carlosdelfino/eli5_clm-model with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "carlosdelfino/eli5_clm-model" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "carlosdelfino/eli5_clm-model", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "carlosdelfino/eli5_clm-model" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "carlosdelfino/eli5_clm-model", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use carlosdelfino/eli5_clm-model with Docker Model Runner:
docker model run hf.co/carlosdelfino/eli5_clm-model
| #!/usr/bin/env python3 | |
| import argparse | |
| import os | |
| import sys | |
| import torch | |
| from transformers import AutoModelForCausalLM, AutoTokenizer | |
| def parse_args(): | |
| parser = argparse.ArgumentParser(description="Teste de inferência para eli5_clm-model (CLM)") | |
| parser.add_argument("--model_dir", type=str, default=".", help="Diretório do modelo (pasta que contém config.json, tokenizer, pesos, etc.)") | |
| parser.add_argument("--prompt", type=str, required=True, help="Texto de entrada para geração") | |
| parser.add_argument("--max_new_tokens", type=int, default=80, help="Máximo de novos tokens a gerar") | |
| parser.add_argument("--temperature", type=float, default=0.7, help="Temperatura para amostragem (criatividade)") | |
| parser.add_argument("--top_p", type=float, default=0.9, help="Top-p (nucleus sampling)") | |
| parser.add_argument("--do_sample", type=lambda x: str(x).lower() in {"1","true","yes","y"}, default=True, | |
| help="Se verdadeiro, usa amostragem; se falso, greedy (padrao: true)") | |
| parser.add_argument("--seed", type=int, default=None, help="Semente para reprodutibilidade") | |
| parser.add_argument("--device", type=str, choices=["auto", "cpu", "cuda"], default="auto", | |
| help="Força dispositivo: auto/cpu/cuda") | |
| return parser.parse_args() | |
| def select_device(choice: str) -> torch.device: | |
| if choice == "cpu": | |
| return torch.device("cpu") | |
| if choice == "cuda": | |
| if torch.cuda.is_available(): | |
| return torch.device("cuda") | |
| print("[aviso] CUDA não disponível, usando CPU.") | |
| return torch.device("cpu") | |
| # auto | |
| if torch.cuda.is_available(): | |
| return torch.device("cuda") | |
| return torch.device("cpu") | |
| def main(): | |
| args = parse_args() | |
| if args.seed is not None: | |
| torch.manual_seed(args.seed) | |
| if torch.cuda.is_available(): | |
| torch.cuda.manual_seed_all(args.seed) | |
| device = select_device(args.device) | |
| print(f"[info] Usando dispositivo: {device}") | |
| model_dir = os.path.abspath(args.model_dir) | |
| if not os.path.isdir(model_dir): | |
| print(f"[erro] Diretório do modelo não encontrado: {model_dir}") | |
| sys.exit(1) | |
| print("[info] Carregando tokenizer e modelo...") | |
| tokenizer = AutoTokenizer.from_pretrained(model_dir) | |
| model = AutoModelForCausalLM.from_pretrained(model_dir) | |
| model.to(device) | |
| model.eval() | |
| inputs = tokenizer(args.prompt, return_tensors="pt") | |
| inputs = {k: v.to(device) for k, v in inputs.items()} | |
| gen_kwargs = { | |
| "max_new_tokens": args.max_new_tokens, | |
| "do_sample": args.do_sample, | |
| } | |
| if args.do_sample: | |
| gen_kwargs.update({ | |
| "temperature": args.temperature, | |
| "top_p": args.top_p, | |
| }) | |
| print("[info] Gerando texto...") | |
| with torch.no_grad(): | |
| outputs = model.generate(**inputs, **gen_kwargs) | |
| full_text = tokenizer.decode(outputs[0], skip_special_tokens=True) | |
| print("\n=== Saída completa ===\n") | |
| print(full_text) | |
| # Tentar extrair apenas a continuação gerada (se compatível com o tokenizer) | |
| try: | |
| prompt_len = len(tokenizer.decode(inputs["input_ids"][0], skip_special_tokens=True)) | |
| print("\n=== Continuação gerada ===\n") | |
| print(full_text[prompt_len:]) | |
| except Exception: | |
| pass | |
| if __name__ == "__main__": | |
| main() | |