HomeGids
Ongecensureerde AI in je applicatie integreren
Geüpdatet LLM Sin Censura
Ongecensureerde AI in je applicatie integreren geeft je directe antwoorden van het model zonder de frequente weigeringen van grote aanbieders. Deze technische gids legt uit hoe je een OpenAI-compatibele endpoint verbindt, context beheert en streaming gebruikt voor soepele, ongecensureerde gebruikerservaringen.
Wat is Ongecensureerde AI?
Ongecensureerde AI verwijst naar een LLM dat is afgestemd of geconfigureerd om geen volwassen content, controverses of niche-onderwerpen af te wijzen op basis van strikte bedrijfsbeleid. In tegenstelling tot standaard commerciële modellen die fout 400 of generieke tekst retourneren bij het detecteren van bepaalde patronen, retourneert een ongecensureerd model precies wat wordt gevraagd, zolang het legaal is.
Deze functie is cruciaal voor applicaties op het gebied van creativiteit, onderzoek of omgevingen waar de vrijheid van meningsuiting van het model voorop staat. Het betekent niet dat het model 'dom' is of geen intelligentie bezit; het verwijdert gewoon de lagen van oppervlakkige moderatie die soms geldige antwoorden blokkeren. Voor de ontwikkelaar vereenvoudigt dit de foutafhandeling, omdat je niet hoeft te voorspellen welke content door een externe filter wordt geblokkeerd.
- Voorspelbaarheid: Je krijgt de volledige tekst zonder willekeurige onderbrekingen.
- Controle: Jij beslist welke content wordt getoond, niet de API.
- Efficiëntie: Minder mislukte API-verzoeken door verkeerde moderatie.
Initiële SDK-configuratie
Voor de integratie van onze ongecensureerde AI gebruiken we de standaard OpenAI-SDK, omdat onze endpoint 100% compatibel is met hun protocol. Hiermee kun je bibliotheken gebruiken die je al kent, zoals openai in Python of openai in Node.js. Je hoeft alleen de basis-URL aan te passen en je API-sleutel op te geven.
Het voordeel van deze aanpak is draagbaarheid. Als je in de toekomst van aanbieder wilt wisselen die ook een compatibele endpoint biedt, is de wijziging in je code minimaal. Hier zie je hoe je de client in Python configureert met verwijzing naar onze service:
from openai import OpenAI
client = OpenAI(base_url="https://api.llmsincensura.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Onthoud dat compatibiliteit betekent dat we hetzelfde JSON-aanvraag- en responsformaat gebruiken, wat migratie van andere platforms of het ontwikkelen van unit-tests met standaard mocks vergemakkelijkt.
Authenticatie met API-sleutel
De beveiliging van onze API wordt beheerd via één API-sleutel per account. Deze sleutel wordt direct na registratie gegenereerd en één keer getoond. Het is belangrijk te begrijpen dat er standaard geen meerdere sleutels zijn; je account heeft een hoofdidentificatie voor je verzoeken.
Als je de toegang wilt intrekken of een nieuwe token wilt genereren om veiligheidsredenen, kun je je sleutel regenereren in de accountinstellingen. Houd er rekening mee dat dit de vorige sleutel direct ongeldig maakt. Het is geen manier om je snelheidslimiet te verhogen, maar een veiligheidsmaatregel om slechts één actief controlepunt te hebben. Sla je sleutel op in omgevingsvariabelen en maak deze niet bloot in clientcode als je applicatie publiek is.
- Generatie: Wordt getoond bij registratie.
- Regeneratie: Maakt de vorige sleutel ongeldig.
- Gebruik: Wordt verzonden in de header
Authorization: Bearer YOUR_KEY.
Verzenden van het eerste verzoek
De basisbewerking is een POST-verzoek naar /v1/chat/completions. Je moet het model instellen op uncensored, een systeem prompt definiëren indien nodig om de toon vast te leggen, en de berichtengeschiedenis of de eenvoudige gebruikersvraag verstrekken. Het model verwerkt de invoer en retourneert een volledige respons in JSON-formaat.
Dit is de eenvoudigstestroom om te valideren dat je integratie werkt. Zorg ervoor dat je applicatie de responsen van het model correct afhandelt, inclusief de gegenereerde inhoud en gebruiksmetadata, zoals het aantal verbruikte tokens.
curl https://api.llmsincensura.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Dit verzoek is de basis voor elke chatapplicatie, contentgeneratie of tekstanalyse. Als het model correct reageert, zijn je netwerkconfiguratie en authenticatie correct.
Streaming afhandelen
Voor interactieve applicaties zoals chatbots is het essentieel om streaming te gebruiken. Hierdoor worden tokens naar de client verzonden zodra ze worden gegenereerd, wat de waargenomen latentie verbetert. Onze API ondersteunt Server-Sent Events (SSE) hiervoor.
Als je streaming in je SDK inschakelt, ontvang je meerdere gedeeltelijke gebeurtenissen. Je moet deze fragmenten concateneren om de volledige respons te bouwen. Dit is vooral nuttig wanneer het model lange teksten genereert, omdat de gebruiker bijna direct tekst begint te zien.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Streaming verbruikt geen extra tokens dan een niet-streaming verzoek; het verandert alleen de manier waarop de data wordt getransporteerd. Het is de aanbevolen praktijk voor elke moderne gebruikersinterface die afhankelijk is van AI.
Beheer van 100k-context
Een van de grootste uitdagingen bij LLM-ontwikkeling is de contextlimiet. Onze API biedt een contextvenster van 100.000 tokens. Dit is voldoende om uitgebreide documenten, lange gespreksgeschiedenissen of grote kennisbases in één verzoek te laden.
Om dit efficiënt te benutten, moet je de sliding window in je applicatie beheren. Naarmate het gesprek groeit, kun je de oudste berichten uit de geschiedenis verwijderen die je naar het model stuurt om binnen de limiet te blijven. De context omvat zowel de invoertokens (prompt) als de uitvoertokens (completion).
- Capaciteit: 100k tokens in totaal.
- Strategie: Implementeer een circular buffer voor de berichten.
- Kosten: Tokens worden gefactureerd op basis van gebruik, dus optimaliseer het versturen van onnodige context.
Gebruik van tool calling
Met functions (tool calling) kan het model communiceren met jouw externe code. Je kunt functies definiëren zoals get_weather of search_database en het model retourneert een gestructureerd argument om ze aan te roepen. Dit is essentieel voor applicaties die realtime gegevens of specifieke acties nodig hebben.
Ons ongecensureerde model ondersteunt tool calling op exact dezelfde manier als de OpenAI-standaard. Je definieert de tools in de parameter tools en het model reageert met een call-id. Jouw code voert de functie uit en stuurt het resultaat terug naar het model, zodat dit de eindantwoord kan genereren op basis van die gegevens.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmsincensura.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Deze aanpak verandert een passief taalmodel in een actief agent die complexe taken in jouw applicatie kan uitvoeren.
Limieten en quota's
Om de stabiliteit van de service te garanderen, hanteert onze API rate limits en groottebeperkingen. Elke API-sleutel is beperkt tot 300 verzoeken per minuut. Dit is voldoende voor de meeste applicaties met gemiddeld gebruik, maar als jouw applicatie pieken in het verkeer heeft, moet je overwegen een request queue aan jouw kant te implementeren.
Bovendien mag de request body niet groter zijn dan 8 MB. Dit beperkt de grootte van tekst- of JSON-bestanden die je in één verzoek kunt versturen. Als je meer gegevens moet versturen, overweeg dan deze op te splitsen in meerdere verzoeken of samen te vatten voordat je ze verstuurt.
| Bron | Limiet |
|---|---|
| Snelheid | 300 req/min |
| Requestgrootte | 8 MB |
| Model | ongecensureerd |
Facturatie en opwaarderen
Het prijsmodel is pay-as-you-go, zonder verplichte maandelijkse abonnementen. Er wordt gefactureerd per miljoen tokens. De kosten zijn $0,25 per 1M input tokens en $1,00 per 1M output tokens. Deze structuur is transparant en voorspelbaar.
Je kunt je account opwaarderen met minimaal $10 met cryptocurrency (USDT of USDC). Als je grotere bedragen opwaardeert, ontvang je bonussen: 5% extra bij opwaarderingen van $50 of meer, en 10% extra bij opwaarderingen van $100 of meer. Het tegoed vervalt niet, dus je kunt het gebruiken wanneer je maar wilt, zonder tijdsdruk.
- Inputprijs: $0,25 / 1M tokens.
- Outputprijs: $1,00 / 1M tokens.
- Bonussen: +5% vanaf $50, +10% vanaf $100.
Veelgestelde vragen
Is dit model een kopie van GPT of Claude?
Nee. Het is een open-weight model dat op onze eigen GPU-servers draait, specifiek afgestemd om ongecensureerd te zijn. Het is geen GPT, Claude, Gemini of een ander model van een externe aanbieder, maar het is wel compatibel met hun API-formaat.
Wat gebeurt er als ik de limiet van 300 verzoeken per minuut overschrijd?
De API retourneert een rate limit-fout. Je moet wachten tot de teller is gereset of retry-logica met exponentiële back-off implementeren in jouw applicatie. Je API-sleutel regenereren verhoogt deze limiet niet, omdat deze per account en sleutel geldt.
Worden mijn prompts gebruikt om het model te trainen?
Nee. Ons privacybeleid is streng. De prompts die je naar de API stuurt, worden niet gebruikt voor het trainen van het model, wat de vertrouwelijkheid van jouw gegevens en gesprekken garandeert.
Kan ik deze API gebruiken voor NSFW-content?
Ja, het model is ontworpen om legale volwassen content niet te censureren. Wel wordt altijd content geblokkeerd die seksueel misbruik van minderjarigen inhoudt, ongeacht de jurisdictie. Voor de rest van de volwassen content biedt het model geen weigeringen op basis van gemak.
Je sleutel is binnen handbereik
Maak een account aan, kopieer de sleutel en pas de basis-URL aan. Zo simpel is het.
API-sleutel verkrijgen