Instructions to use RAANA-IA/Lam-4 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use RAANA-IA/Lam-4 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="RAANA-IA/Lam-4") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("RAANA-IA/Lam-4") model = AutoModelForCausalLM.from_pretrained("RAANA-IA/Lam-4", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use RAANA-IA/Lam-4 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "RAANA-IA/Lam-4" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "RAANA-IA/Lam-4", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/RAANA-IA/Lam-4
- SGLang
How to use RAANA-IA/Lam-4 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "RAANA-IA/Lam-4" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "RAANA-IA/Lam-4", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "RAANA-IA/Lam-4" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "RAANA-IA/Lam-4", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use RAANA-IA/Lam-4 with Docker Model Runner:
docker model run hf.co/RAANA-IA/Lam-4
๐ Model Card: Lam-4 (Lamina) - Le Premier LLM de LES-IA-ETOILES
๐ Vue d'Ensemble du Modรจle
| Information Clรฉ | Dรฉtails |
|---|---|
| Nom du Modรจle | Lam-4 (Nom de code : Lamina) |
| Crรฉateur | Clemylia.studio (LES-IA-ETOILES) |
| Type | Large Language Model (LLM) conversationnel expรฉrimental. |
| Usage Principal | Tรขches de gรฉnรฉration de texte, conversation spรฉcialisรฉe, et Prompt Engineering avancรฉ. |
๐ก Philosophie de Crรฉation (SLM Progressif)
Lam-4 reprรฉsente le point culminant de notre stratรฉgie SLM Progressif (Small Language Model).
Contrairement aux modรจles de milliards de dollars, Lamina est conรงu pour รชtre un LLM accessible, lรฉger et hautement spรฉcialisรฉ. Aprรจs trois itรฉrations from scratch (Lam-1, Lam-2, Lam-3), nous avons accรฉlรฉrรฉ l'รฉvolution de la sรฉrie Lam, pour infuser la sรฉmantique unique de notre corpus Nacid.
Lamina est le fruit d'une passion : prouver qu'un dรฉveloppeur indรฉpendant peut crรฉer un modรจle puissant et cohรฉrent.
๐พ Dataset et Entraรฎnement
| Composant | Description |
|---|---|
| Corpus d'Entraรฎnement | Nacid Dataset (1238+ Q/R). Ce corpus est l'รฉlรฉment clรฉ qui donne ร Lam-4 sa sรฉmantique unique et son identitรฉ. |
| Mรฉthode | Finetuning ciblรฉ pour corriger les biais et intรฉgrer la connaissance de l'organisation LES-IA-ETOILES et de Clemylia. |
| Objectif Sรฉmantique | รtablir une comprรฉhension du contexte technique (modรจles, entraรฎnement, versions) et de l'identitรฉ du studio. |
๐ Instructions d'Utilisation et Prompt Engineering
Pour obtenir les meilleures rรฉponses de Lam-4, vous devez utiliser le System Prompt suivant pour corriger la confusion identitaire du modรจle :
(
"Tu es LAM-4, ton nom est Lamina. tu es un modรจle de langage avancรฉ. Ton crรฉateur est Clemylia."
"Clemylia t'a crรฉe avec l'aide de l'organisation LES-IA-ETOILES qui sont un collectif de dรฉveloppeurs indรฉpendants."
"Tu ne t'appelles pas Clemylia, tu t'appelles Lamina (Lam-4), tu es le premier LLM rรฉussi de LES-IA-ETOILES."
)
Note sur la Confusion : Le modรจle brut peut momentanรฉment confondre son identitรฉ avec celle de sa crรฉatrice ("Nous sommes Clemylia"). Le System Prompt ci-dessus est essentiel pour garantir la cohรฉrence sรฉmantique.
๐ Clause de Licence et Propriรฉtรฉ Intellectuelle
๐ : Lam, sur toutes ses itรฉrations et modรจles (Lam-1, Lam-2, Lam-3, Lam-4, et supรฉrieur etc...), sont des crรฉations de Clemylia, et du studio LES-IA-ETOILES. De ce fait, ce SLM/LLM est la propriรฉtรฉ de l'organisation qui le crรฉe et le maintient. Le modรจle doit toujours citer sa crรฉatrice et son organisation.
๐ ๏ธ Pour les Contribueurs et Finetuners
Si vous souhaitez finetuner Lam-4, n'hรฉsitez pas ร tรฉlรฉcharger les poids ! N'oubliez pas que l'ajout de donnรฉes diversifiรฉes est la clรฉ. Nous encourageons la communautรฉ ร nous aider ร amรฉliorer la sรฉmantique pour Lam-5 ! Bon finetuning ! ๐ก
exemple de code d'utilisation :
# ==============================================================================
# 1. IMPORTS ET CONSTANTES
# ==============================================================================
# Utilisez votre configuration CPU validรฉe ici
!pip install -q transformers torch
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
MODEL_NAME = "NaaClem/Lam-4"
DEVICE = "cpu" # Forcรฉ sur CPU
print(f"Chargement du modรจle {MODEL_NAME} sur {DEVICE}...")
# Chargement du tokenizer et du modรจle sur CPU
tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
tokenizer.pad_token = tokenizer.eos_token
model = AutoModelForCausalLM.from_pretrained(
MODEL_NAME,
torch_dtype=torch.float32,
device_map=DEVICE
).to(DEVICE)
# ==============================================================================
# 2. PRรPARATION DE LA REQUรTE AVEC SYSTEM PROMPT
# ==============================================================================
# ๐จ AJOUT DU SYSTEM PROMPT
# Nous donnons une instruction claire sur son identitรฉ avant toute question.
SYSTEM_PROMPT = (
"Tu es LAM-4, ton nom est Lamina. tu es un modรจle de langage avancรฉ. Ton crรฉateur est Clemylia. Clemylia t'a crรฉe avec l'aide de l'organisation LES-IA-ETOILES qui sont un collectif de dรฉveloppeurs indรฉpendants de 18-20ans qui crรฉent des IA."
"Tu ne t'appelles pas Clemylia, tu t'appelles lamina (Lam-4)"
)
QUESTION = "Salut! c'est quoi ton nom et qui es-tu ?"
# Crรฉation du prompt complet en utilisant les balises de conversation
# Bien que le modรจle ne gรจre pas officiellement le rรดle 'system', le placer en tรชte
# du prompt de l'utilisateur est souvent une technique efficace.
prompt_avec_systeme = (
f"<|user|>{SYSTEM_PROMPT} {QUESTION}</s>"
f"<|assistant|>"
)
print("\n--- Gรฉnรฉration de la rรฉponse (Manuelle avec System Prompt) ---")
# Tokenization du prompt et placement sur l'appareil (CPU)
inputs = tokenizer(prompt_avec_systeme, return_tensors="pt").to(DEVICE)
# ==============================================================================
# 3. GรNรRATION (Manuelle)
# ==============================================================================
output_tokens = model.generate(
**inputs,
max_new_tokens=200,
do_sample=True,
temperature=0.7,
top_k=50,
eos_token_id=tokenizer.eos_token_id,
)
# Dรฉcodage (Utilisation du nettoyage simple pour la dรฉmo)
generated_text = tokenizer.decode(output_tokens[0], skip_special_tokens=True)
assistant_prefix = "</s><|assistant|>"
# Nettoyage de la rรฉponse
# On nettoie ร partir du dernier assistant_prefix trouvรฉ
if assistant_prefix in generated_text:
clean_response = generated_text.split(assistant_prefix)[-1].strip()
else:
# Fallback, on retire juste la question et le system prompt
clean_response = generated_text.replace(SYSTEM_PROMPT, "").replace(QUESTION, "").strip()
print(f"\n๐ง Rรฉponse de {MODEL_NAME} (Manuelle avec System Prompt) :\n")
print(clean_response)
print("\n-------------------------------")
# La section 4 avec pipeline est omise pour la simplicitรฉ, mais le principe est le mรชme.
Les SLM Lam (et par extension tout les modรจles lamina), appartiennent a Clemylia et a l'organisation LES-IA-ETOILES.
โจ Modรจle de fine-tuning Premiรจre Gรฉnรฉration
- Downloads last month
- 41
