FR ▾
API sans censure pour l'IA sans filtrellmsincensura.com
$0,25pour 1 M token en entrée
100 000tokens de contexte
Obtenir clé API

AccueilGuide

Comment intégrer l'IA sans filtre dans votre application

Intégrer une IA sans filtre dans votre application permet d'obtenir des réponses directes du modèle sans les refus fréquents des grands fournisseurs. Ce guide technique explique comment connecter un endpoint compatible OpenAI, gérer le contexte et gérer le streaming pour créer des expériences utilisateur fluides et sans censure.

Qu'est-ce que l'IA sans filtre ?

Une IA sans filtre désigne un grand modèle de langage (LLM) qui a été ajusté ou configuré pour ne pas rejeter le contenu adulte, les controverses ou les sujets de niche en fonction de politiques corporatives rigides. Contrairement aux modèles commerciaux standard qui peuvent renvoyer des erreurs 400 ou du texte générique lorsqu'ils détectent certains motifs, un modèle sans censure renvoie exactement ce qui lui est demandé, tant que c'est légal.

Cette fonctionnalité est cruciale pour les applications de créativité, de recherche ou les environnements où la liberté d'expression du modèle est prioritaire. Cela ne signifie pas que le modèle est 'stupide' ou dénué d'intelligence ; il supprime simplement les couches de modération superficielle qui bloquent parfois des réponses valides. Pour le développeur, cela simplifie la logique de gestion des erreurs, car vous n'avez pas besoin de prédire quel contenu sera rejeté par un filtre externe.

  • Prévisibilité : Vous obtenez le texte complet sans coupures arbitraires.
  • Contrôle : Vous décidez du contenu affiché, pas l'API.
  • Efficacité : Moins d'appels API échoués dus à une modération incorrecte.

Configuration initiale du SDK

Pour intégrer notre IA sans censure, nous utiliserons le SDK standard d'OpenAI, car notre endpoint est 100 % compatible avec son protocole. Cela vous permet d'utiliser des bibliothèques que vous connaissez déjà, comme openai en Python ou openai en Node.js. Vous devez simplement ajuster l'URL de base et fournir votre clé API.

L'avantage de cette approche est la portabilité. Si vous décidez à l'avenir de changer de fournisseur qui propose également un endpoint compatible, la modification de votre code sera minime. Voici comment configurer le client en Python en pointant vers notre service :

from openai import OpenAI

client = OpenAI(base_url="https://api.llmsincensura.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

N'oubliez pas que la compatibilité signifie que nous utilisons le même format de requête et de réponse JSON, ce qui facilite la migration depuis d'autres plateformes ou le développement de tests unitaires en utilisant des mocks standard.

Authentification avec clé API

La sécurité de notre API est gérée via une seule clé API par compte. Cette clé est générée immédiatement après l'inscription et affichée une seule fois. Il est important de comprendre qu'il n'y a pas plusieurs clés par défaut ; votre compte dispose d'un identifiant principal pour vos requêtes.

Si vous devez révoquer l'accès ou générer un nouveau token pour des raisons de sécurité, vous pouvez régénérer votre clé dans les paramètres de votre compte. Notez que cela invalide instantanément l'ancienne clé. Ce n'est pas un moyen d'augmenter votre limite de débit, mais une mesure de sécurité pour n'avoir qu'un seul point de contrôle actif. Enregistrez votre clé dans des variables d'environnement et ne l'exposez jamais dans le code côté client si votre application est publique.

  • Génération : Affichée lors de l'inscription.
  • Régénération : Invalide l'ancienne clé.
  • Utilisation : Envoyée dans l'en-tête Authorization: Bearer YOUR_KEY.

Envoi de la première requête

L'opération de base est une requête POST vers /v1/chat/completions. Vous devez spécifier le modèle comme uncensored, définir le prompt système si nécessaire pour établir le ton, et fournir l'historique des messages ou la requête simple de l'utilisateur. Le modèle traitera l'entrée et renverra une réponse complète au format JSON.

Il s'agit du flux le plus simple pour valider que votre intégration fonctionne. Assurez-vous que votre application gère correctement les réponses du modèle, qui incluent le contenu généré et les métadonnées d'utilisation, comme le nombre de tokens consommés.

curl https://api.llmsincensura.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Cette requête est la base de toute application de chat, de génération de contenu ou d'analyse de texte. Si le modèle répond correctement, votre configuration réseau et d'authentification est correcte.

Gestion du streaming

Pour les applications interactives comme les chatbots, il est crucial d'utiliser le streaming. Cela permet l'envoi des tokens au client au fur et à mesure de leur génération, améliorant la perception de la latence. Notre API prend en charge les Server-Sent Events (SSE) à cette fin.

En activant le streaming dans votre SDK, vous recevrez plusieurs événements partiels. Vous devez concaténer ces fragments pour construire la réponse complète. Cela est particulièrement utile lorsque le modèle génère de longs textes, car l'utilisateur commence à voir du texte presque instantanément.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Le streaming ne consomme pas plus de tokens qu'une requête non streaming ; il modifie uniquement la façon dont les données sont transportées. C'est la pratique recommandée pour toute interface utilisateur moderne dépendant de l'IA.

Gestion de la fenêtre de contexte de 100k

L'un des plus grands défis du développement avec les LLM est la limite de contexte. Notre API offre une fenêtre de contexte de 100 000 tokens. Cela suffit pour charger de longs documents, des historiques de conversation longs ou de grandes bases de connaissances en une seule requête.

Pour en tirer parti efficacement, vous devez gérer la fenêtre glissante (sliding window) dans votre application. Au fur et à mesure que la conversation s'allonge, vous pouvez supprimer les messages les plus anciens de l'historique que vous envoyez au modèle pour rester dans la limite. La fenêtre de contexte inclut à la fois les tokens d'entrée (prompt) et les tokens de sortie (completion).

  • Capacité : 100 000 tokens au total.
  • Stratégie : Mettez en place un buffer circulaire pour les messages.
  • Coût : Les tokens sont facturés à l'usage, donc optimisez l'envoi du contexte inutile.

Utilisation de l'appel de fonctions

L'appel de fonctions (tool calling) permet au modèle d'interagir avec votre code externe. Vous pouvez définir des fonctions comme get_weather ou search_database et le modèle renverra un argument structuré pour les appeler. C'est essentiel pour les applications qui ont besoin de données en temps réel ou d'actions spécifiques.

Notre IA sans censure prend en charge l'appel de fonctions de la même manière que le standard OpenAI. Vous définissez les outils dans le paramètre tools et le modèle répond avec un ID d'appel. Votre code exécute la fonction puis renvoie le résultat au modèle pour qu'il génère la réponse finale basée sur ces données.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmsincensura.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Cette approche transforme un modèle de langage passif en un agent actif capable d'effectuer des tâches complexes dans votre application.

Limites et quotas

Pour garantir la stabilité du service, notre API a des limites de débit et de taille. Chaque clé API est limitée à 300 requêtes par minute. Cela suffit pour la plupart des applications à usage moyen, mais si votre application connaît des pics de trafic, vous devez envisager de mettre en place une file d'attente de requêtes de votre côté.

De plus, le corps de la requête ne doit pas dépasser 8 MB. Cela limite la taille des fichiers texte ou JSON que vous pouvez envoyer en une seule demande. Si vous devez envoyer plus de données, envisagez de les diviser en plusieurs requêtes ou de les résumer avant de les envoyer.

RessourceLimite
Débit300 req/min
Taille de la requête8 MB
Modèlesans censure

Facturation et recharges

Le modèle de tarification est au paiement à l'usage, sans abonnements mensuels obligatoires. La facturation se fait par million de tokens. Le coût est de 0,25 $ pour 1 M de tokens d'entrée et de 1,00 $ pour 1 M de tokens de sortie. Cette structure est transparente et prévisible.

Vous pouvez recharger votre compte avec un minimum de 10 $ en utilisant des cryptomonnaies (USDT ou USDC). Si vous rechargez des montants supérieurs, vous recevez des bonus : 5 % supplémentaires pour les recharges de 50 $ ou plus, et 10 % supplémentaires pour les recharges de 100 $ ou plus. Le crédit n'expire jamais, vous pouvez donc l'utiliser quand vous le souhaitez sans pression temporelle.

  • Prix Input : 0,25 $ / 1 M de tokens.
  • Prix Output : 1,00 $ / 1 M de tokens.
  • Bonus : +5 % dès 50 $, +10 % dès 100 $.

Questions fréquentes

Ce modèle est-il une copie de GPT ou de Claude ?

Non. Il s'agit d'un modèle à poids ouverts (open-weight) exécuté sur nos propres serveurs GPU, spécifiquement ajusté pour être sans censure. Ce n'est ni GPT, ni Claude, ni Gemini, ni aucun autre modèle de fournisseur externe, bien qu'il soit compatible avec leur format d'API.

Que se passe-t-il si je dépasse la limite de 300 requêtes par minute ?

L'API renverra une erreur de limite de débit (rate limit). Vous devrez attendre que le compteur se réinitialise ou mettre en œuvre une logique de réessai avec rébackoff exponentiel dans votre application. Régénérer votre clé n'augmente pas cette limite, car elle est par compte et par clé.

Mes prompts sont-ils utilisés pour entraîner le modèle ?

Non. Notre politique de confidentialité est stricte. Les prompts que vous envoyez à l'API ne sont pas utilisés pour l'entraînement du modèle, garantissant ainsi la confidentialité de vos données et de vos conversations.

Puis-je utiliser cette API pour du contenu NSFW ?

Oui, le modèle est conçu pour ne pas censurer le contenu adulte légal. Cependant, le contenu sexuel impliquant des mineurs est toujours bloqué, quelle que soit la juridiction. Pour le reste du contenu adulte, le modèle ne propose pas de refus basés sur la commodité.

Votre clé est à portée de main

Créez un compte, copiez la clé et modifiez l'URL de base. C'est aussi simple que ça.

Obtenir clé API