DE ▾
Unzensierte API für KI ohne Inhaltsfilterllmsincensura.com
$0,25pro 1M Eingabe-Token
100.000Kontextfenster-Token
API-Schlüssel erhalten

StartseiteLeitfaden

Integration unzensierter KI in deine Anwendung

Die Integration einer unzensierten KI in deine Anwendung ermöglicht direkte Antworten des Modells ohne die häufigen Ablehnungen großer Anbieter. Dieser technische Leitfaden erklärt, wie du einen OpenAI-kompatiblen Endpunkt verbindest, den Kontext verwaltest und Streaming nutzt, um nahtlose und unzensierte Nutzererfahrungen zu erstellen.

Was ist unzensierte KI?

Ein unzensierter KI bezieht sich auf ein Large Language Model (LLM), das feinabgestimmt oder so konfiguriert wurde, dass es Erwachseneninhalt, Kontroversen oder Nischenthemen nicht aufgrund starrer Unternehmensrichtlinien ablehnt. Im Gegensatz zu Standard-Commercial-Modellen, die bei der Erkennung bestimmter Muster Fehler 400 oder generischen Text zurückgeben können, gibt ein unzensiertes Modell genau das zurück, was angefordert wird, solange es legal ist.

Diese Funktion ist entscheidend für Anwendungen in Kreativität, Forschung oder Umgebungen, in denen die Meinungsfreiheit des Modells Priorität hat. Das bedeutet nicht, dass das Modell „dumm“ ist oder keine Intelligenz besitzt; es entfernt einfach die Schichten der Oberflächenmoderation, die manchmal gültige Antworten blockieren. Für Entwickler vereinfacht dies die Fehlerbehandlungslogik, da du nicht vorhersagen musst, welche Inhalte von einem externen Filter abgelehnt werden.

  • Vorhersagbarkeit: Du erhältst den vollständigen Text ohne willkürliche Unterbrechungen.
  • Kontrolle: Du entscheidest, welcher Inhalt angezeigt wird, nicht die API.
  • Effizienz: Weniger fehlgeschlagene API-Anfragen durch falsche Moderation.

SDK-Einrichtung

Um unsere unzensierte KI zu integrieren, verwenden wir das Standard-OpenAI-SDK, da unser Endpunkt zu 100 % mit ihrem Protokoll kompatibel ist. So kannst du Bibliotheken nutzen, die du bereits kennst, wie openai in Python oder openai in Node.js. Du musst nur die Basis-URL anpassen und deinen API-Schlüssel angeben.

Der Vorteil dieses Ansatzes ist die Portabilität. Wenn du dich später entscheidest, den Anbieter zu wechseln, der ebenfalls einen kompatiblen Endpunkt anbietet, ist die Änderung in deinem Code minimal. Hier siehst du, wie du den Client in Python auf unseren Dienst ausrichtest:

from openai import OpenAI

client = OpenAI(base_url="https://api.llmsincensura.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Denk daran, dass Kompatibilität bedeutet, dass wir das gleiche JSON-Anfrage- und Antwortformat verwenden, was die Migration von anderen Plattformen oder die Entwicklung von Unit-Tests mit Standard-Mocks erleichtert.

Authentifizierung mit API-Schlüssel

Die Sicherheit unserer API wird durch einen einzigen API-Schlüssel pro Konto verwaltet. Dieser Schlüssel wird sofort nach der Registrierung generiert und einmalig angezeigt. Es ist wichtig zu verstehen, dass es standardmäßig keine mehreren Schlüssel gibt; dein Konto hat eine Hauptkennung für deine Anfragen.

Wenn du den Zugriff widerrufen oder aus Sicherheitsgründen einen neuen Token generieren musst, kannst du deinen Schlüssel in den Kontoeinstellungen regenerieren. Beachte, dass dies den vorherigen Schlüssel sofort ungültig macht. Dies ist keine Möglichkeit, dein Ratenlimit zu erhöhen, sondern eine Sicherheitsmaßnahme, um nur einen aktiven Kontrollpunkt zu haben. Speichere deinen Schlüssel in Umgebungsvariablen und gib ihn niemals im Client-Code aus, wenn deine Anwendung öffentlich ist.

  • Generierung: Wird bei der Anmeldung angezeigt.
  • Regenerierung: Macht den vorherigen Schlüssel ungültig.
  • Verwendung: Wird im Header Authorization: Bearer YOUR_KEY gesendet.

Erste Anfrage senden

Die Grundoperation ist eine POST-Anfrage an /v1/chat/completions. Du musst das Modell als uncensored angeben, den System-Prompt definieren, falls erforderlich, um den Ton festzulegen, und den Nachrichtenverlauf oder die einfache Benutzerabfrage bereitstellen. Das Modell verarbeitet die Eingabe und gibt eine vollständige Antwort im JSON-Format zurück.

Dies ist der einfachste Ablauf, um zu validieren, dass deine Integration funktioniert. Stelle sicher, dass deine Anwendung die Antworten des Modells korrekt verarbeitet, die generierten Inhalt und Nutzungsmetadaten wie die Anzahl der verbrauchten Token enthalten.

curl https://api.llmsincensura.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Diese Anfrage ist die Grundlage für jede Chat-Anwendung, Inhaltsgenerierung oder Textanalyse. Wenn das Modell korrekt antwortet, sind deine Netzwerk- und Authentifizierungskonfiguration korrekt.

Streaming-Verarbeitung

Für interaktive Anwendungen wie Chatbots ist die Nutzung von Streaming entscheidend. Dies ermöglicht es, Token an den Client zu senden, während sie generiert werden, was die Latenzwahrnehmung verbessert. Unsere API unterstützt Server-Sent Events (SSE) für diesen Zweck.

Wenn du das Streaming in deinem SDK aktivierst, empfängst du mehrere Teilereignisse. Du musst diese Fragmente verketten, um die vollständige Antwort zu erstellen. Dies ist besonders nützlich, wenn das Modell lange Texte generiert, da der Benutzer fast sofort Text sieht.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Streaming verbraucht nicht mehr Token als eine nicht-streaming-Anfrage; es ändert nur die Art und Weise, wie die Daten transportiert werden. Es ist die empfohlene Praxis für jede moderne Benutzeroberfläche, die auf KI angewiesen ist.

Verwaltung des 100k-Kontexts

Eine der größten Herausforderungen bei der Entwicklung mit LLMs ist das Kontextlimit. Unsere API bietet ein Kontextfenster von 100.000 Token. Dies reicht aus, um umfangreiche Dokumente, lange Gesprächsverläufe oder große Wissensdatenbanken in einer einzigen Anfrage zu laden.

Um dies effizient zu nutzen, musst du das Gleitfenster (Sliding Window) in deiner Anwendung verwalten. Wenn das Gespräch wächst, kannst du die ältesten Nachrichten aus dem Verlauf entfernen, den du an das Modell sendest, um innerhalb des Limits zu bleiben. Der Kontext umfasst sowohl Input-Token (Prompt) als auch Output-Token (Completion).

  • Kapazität: 100k Token insgesamt.
  • Strategie: Implementiere einen Ringpuffer für die Nachrichten.
  • Kosten: Token werden nach Verbrauch abgerechnet, also optimiere die Überflüssung von Kontext.

Nutzung von Function Calling

Funktionen (Function Calling) ermöglichen es dem Modell, mit deinem externen Code zu interagieren. Du kannst Funktionen wie get_weather oder search_database definieren, und das Modell gibt ein strukturiertes Argument zurück, um sie aufzurufen. Dies ist essenziell für Anwendungen, die Echtzeitdaten oder spezifische Aktionen benötigen.

Unsere unzensierte KI unterstützt Function Calling auf die gleiche Weise wie der OpenAI-Standard. Du definierst die Tools im Parameter tools, und das Modell antwortet mit einer Call-ID. Dein Code führt die Funktion aus und sendet das Ergebnis zurück an das Modell, damit es die finale Antwort basierend auf diesen Daten generiert.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmsincensura.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Dieser Ansatz verwandelt ein passives Sprachmodell in einen aktiven Agenten, der komplexe Aufgaben in deiner Anwendung ausführen kann.

Grenzen und Kontingente

Um die Stabilität des Dienstes zu gewährleisten, hat unsere API Ratenlimits und Größenbeschränkungen. Jeder API-Schlüssel ist auf 300 Anfragen pro Minute begrenzt. Dies reicht für die meisten mittelgroßen Anwendungen aus, aber wenn deine Anwendung Traffic-Spitzen hat, solltest du in Erwägung ziehen, eine Warteschlange für parallele Anfragen auf deiner Seite zu implementieren.

Darüber hinaus darf der Anfragetext 8 MB nicht überschreiten. Dies begrenzt die Größe der Text- oder JSON-Dateien, die du in einer einzelnen Anfrage senden kannst. Wenn du mehr Daten senden musst, überlege, sie in mehrere Anfragen aufzuteilen oder vor dem Senden zusammenzufassen.

RessourceGrenzwert
Geschwindigkeit300 req/min
Anfragetext8 MB
Modellunzensiert

Abrechnung und Aufladung

Das Preismodell ist Pay as you go, ohne monatliche Abonnements. Abgerechnet wird pro Million Token. Die Kosten betragen $0,25 pro 1M Input-Token und $1,00 pro 1M Output-Token. Diese Struktur ist transparent und vorhersehbar.

Du kannst dein Konto mit einem Mindestbetrag von $10 mit Kryptowährungen (USDT oder USDC) aufladen. Wenn du höhere Beträge auflädst, erhältst du Boni: 5 % extra bei Aufladungen ab $50 und 10 % extra bei Aufladungen ab $100. Das Guthaben verfällt nie, sodass du es ohne Zeitdruck nutzen kannst.

  • Input-Preis: $0,25 / 1M Token.
  • Output-Preis: $1,00 / 1M Token.
  • Boni: +5 % ab $50, +10 % ab $100.

Häufig gestellte Fragen

Ist dieses Modell eine Kopie von GPT oder Claude?

Nein. Es ist ein Open-Weight-Modell, das auf unseren eigenen GPU-Servern läuft und speziell für Unzensierbarkeit angepasst wurde. Es ist kein GPT, Claude, Gemini oder ein anderes Modell eines externen Anbieters, obwohl es mit deren API-Format kompatibel ist.

Was passiert, wenn ich das Limit von 300 Anfragen pro Minute überschreite?

Die API gibt einen Ratenlimit-Fehler zurück. Du musst warten, bis sich der Zähler zurücksetzt, oder eine Retry-Logik mit exponentiellem Backoff in deiner Anwendung implementieren. Das Erzeugen eines neuen Schlüssels erhöht dieses Limit nicht, da es kontozentriert und schlüsselbasiert ist.

Werden meine Prompts zum Trainieren des Modells verwendet?

Nein. Unsere Datenschutzrichtlinie ist streng. Die Prompts, die du an die API sendest, werden nicht zum Training des Modells verwendet, was die Vertraulichkeit deiner Daten und Gespräche garantiert.

Kann ich diese API für NSFW-Inhalte nutzen?

Ja, das Modell ist darauf ausgelegt, legale erwachsene Inhalte nicht zu zensieren. Allerdings wird immer Sexualinhalte mit Minderjährigen blockiert, unabhängig von der Rechtsordnung. Für den Rest der erwachsenen Inhalte bietet das Modell keine Ablehnungen aus Bequemlichkeit.

Dein Schlüssel ist nur einen Schritt entfernt

Erstelle ein Konto, kopiere den Schlüssel und ändere die Basis-URL. So einfach ist das.

API-Schlüssel erhalten