PT ▾
API sem censura para IA sem filtrosllmsincensura.com
$0,25por 1M tokens de entrada
100.000janela de contexto
Obter chave de API

InícioGuia

Como Integrar IA sem Filtro na sua Aplicação

Integrar uma IA sem filtro na sua aplicação permite obter respostas diretas do modelo sem as recusas frequentes dos grandes provedores. Este guia técnico explica como conectar um endpoint compatível com OpenAI, gerenciar o contexto e lidar com streaming para construir experiências de usuário fluidas e sem censura.

O que é IA sem Filtro?

Uma IA sem filtro refere-se a um modelo de linguagem grande (LLM) que foi ajustado ou configurado para não rejeitar conteúdo adulto, controvérsias ou temas de nicho com base em políticas corporativas rígidas. Diferente dos modelos comerciais padrão que podem retornar erros 400 ou texto genérico ao detectar certos padrões, um modelo sem censura retorna exatamente o que é solicitado, desde que seja legal.

Essa característica é crucial para aplicações de criatividade, pesquisa ou ambientes onde a liberdade de expressão do modelo é prioritária. Não significa que o modelo seja 'burro' ou careça de inteligência; simplesmente remove as camadas de moderação superficial que às vezes bloqueiam respostas válidas. Para o desenvolvedor, isso simplifica a lógica de tratamento de erros, pois você não precisa prever qual conteúdo será rejeitado por um filtro externo.

  • Previsibilidade: Você obtém o texto completo sem cortes arbitrários.
  • Controle: Você decide qual conteúdo exibir, não a API.
  • Eficiência: Menos chamadas falhas à API por moderação incorreta.

Configuração Inicial do SDK

Para integrar nossa IA sem censura, utilizaremos o SDK padrão da OpenAI, já que nosso endpoint é 100% compatível com o protocolo dela. Isso permite que você use bibliotecas que já conhece, como openai em Python ou openai em Node.js. Basta ajustar a URL base e fornecer sua chave de API.

A vantagem dessa abordagem é a portabilidade. Se no futuro você decidir mudar de provedor que também ofereça um endpoint compatível, a alteração no seu código será mínima. Veja abaixo como configurar o cliente em Python apontando para nosso serviço:

from openai import OpenAI

client = OpenAI(base_url="https://api.llmsincensura.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Lembre-se de que a compatibilidade significa que utilizamos o mesmo formato de solicitação e resposta JSON, o que facilita a migração de outras plataformas ou o desenvolvimento de testes unitários usando mocks padrão.

Autenticação com Chave de API

A segurança na nossa API é gerenciada por meio de uma única chave de API por conta. Essa chave é gerada imediatamente após o registro e exibida uma vez. É importante entender que não há múltiplas chaves por padrão; sua conta tem um identificador principal para suas solicitações.

Se você precisar revogar o acesso ou gerar um novo token por segurança, pode regenerar sua chave na configuração da sua conta. Observe que isso invalida a chave anterior instantaneamente. Não é uma forma de aumentar seu limite de velocidade, mas uma medida de segurança para manter apenas um ponto de controle ativo. Armazene sua chave em variáveis de ambiente e nunca a exponha no código do lado do cliente se sua aplicação for pública.

  • Gênero: É exibido durante o registro.
  • Regeneração: Invalida a chave anterior.
  • Uso: Enviada no cabeçalho Authorization: Bearer YOUR_KEY.

Envio da Primeira Requisição

A operação básica é uma solicitação POST para /v1/chat/completions. Você deve especificar o modelo como uncensored, definir o prompt do sistema se necessário para estabelecer o tom, e fornecer o histórico de mensagens ou a consulta simples do usuário. O modelo processará a entrada e retornará uma resposta completa em formato JSON.

Este é o fluxo mais simples para validar se sua integração está funcionando. Certifique-se de que sua aplicação trate corretamente as respostas do modelo, que incluem o conteúdo gerado e os metadados de uso, como o número de tokens consumidos.

curl https://api.llmsincensura.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Essa solicitação é a base para qualquer aplicação de chat, geração de conteúdo ou análise de texto. Se o modelo responder corretamente, sua configuração de rede e autenticação está correta.

Tratamento de Streaming

Para aplicações interativas como chatbots, é crucial utilizar o streaming. Isso permite que os tokens sejam enviados ao cliente conforme são gerados, melhorando a percepção de latência. Nossa API suporta Server-Sent Events (SSE) para esse propósito.

Ao habilitar o streaming no seu SDK, você receberá vários eventos parciais. Você deve concatenar esses fragmentos para construir a resposta completa. Isso é especialmente útil quando o modelo gera textos longos, pois o usuário começa a ver texto quase instantaneamente.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

O streaming não consome mais tokens do que uma solicitação sem streaming; apenas muda a forma como os dados são transportados. É a prática recomendada para qualquer interface de usuário moderna que dependa de IA.

Gerenciamento do Contexto de 100k

Um dos maiores desafios no desenvolvimento com LLMs é o limite de contexto. Nossa API oferece uma janela de contexto de 100.000 tokens. Isso é suficiente para carregar documentos extensos, históricos de conversas longos ou grandes bases de conhecimento em uma única solicitação.

Para aproveitar isso de forma eficiente, você deve gerenciar a janela deslizante (sliding window) na sua aplicação. Conforme a conversa cresce, você pode remover as mensagens mais antigas do histórico que envia ao modelo para permanecer dentro do limite. O contexto inclui tanto os tokens de entrada (prompt) quanto os de saída (completion).

  • Capacidade: 100k tokens totais.
  • Estratégia: Implemente um buffer circular para as mensagens.
  • Custo: Os tokens são cobrados por uso, então otimize o envio de contexto desnecessário.

Uso de chamada de funções

As funções (chamada de funções) permitem que o modelo interaja com seu código externo. Você pode definir funções como get_weather ou search_database e o modelo retornará um argumento estruturado para chamá-las. Isso é essencial para aplicações que precisam de dados em tempo real ou ações específicas.

Nossa IA sem censura suporta chamada de funções da mesma forma que o padrão OpenAI. Você define as ferramentas no parâmetro tools e o modelo responde com um ID de chamada. Seu código executa a função e depois envia o resultado de volta ao modelo para gerar a resposta final com base nesse dado.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmsincensura.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Essa abordagem transforma um modelo de linguagem passivo em um agente ativo capaz de realizar tarefas complexas na sua aplicação.

Limites e cotas

Para garantir a estabilidade do serviço, nossa API tem limites de velocidade e tamanho. Cada chave de API está limitada a 300 requisições por minuto. Isso é suficiente para a maioria das aplicações de uso médio, mas se sua aplicação tiver picos de tráfego, considere implementar uma fila de requisições do seu lado.

Além disso, o corpo da requisição não deve exceder 8 MB. Isso limita o tamanho dos arquivos de texto ou JSON que você pode enviar em uma única solicitação. Se precisar enviar mais dados, considere dividi-los em várias requisições ou resumi-los antes de enviar.

RecursoLimite
Velocidade300 req/min
Tamanho da requisição8 MB
Modelosem censura

Faturamento e recargas

O modelo de preços é pagamento por uso, sem mensalidades obrigatórias. A cobrança é por milhão de tokens. O custo é de $0,25 por 1M de tokens de entrada e $1,00 por 1M de tokens de saída. Essa estrutura é transparente e previsível.

Você pode recarregar sua conta com um mínimo de $10 usando criptomoedas (USDT ou USDC). Se você recargar valores maiores, recebe bônus: 5% extras para recargas de $50 ou mais, e 10% extras para recargas de $100 ou mais. O crédito nunca expira, então você pode usá-lo quando precisar, sem pressão de tempo.

  • Preço de entrada: $0,25 / 1M tokens.
  • Preço de saída: $1,00 / 1M tokens.
  • Bônus: +5% a partir de $50, +10% a partir de $100.

Perguntas frequentes

Este modelo é uma cópia do GPT ou do Claude?

Não. É um modelo de pesos abertos (open-weight) executado em nossos próprios servidores GPU, ajustado especificamente para ser sem censura. Não é GPT, Claude, Gemini nem nenhum outro modelo de provedor externo, embora seja compatível com o formato de API deles.

O que acontece se eu exceder o limite de 300 requisições por minuto?

A API retornará um erro de limite de requisições (rate limit). Você deverá aguardar que o contador seja redefinido ou implementar lógica de retry com backoff exponencial no seu aplicativo. Regenerar sua chave não aumenta esse limite, pois ele é por conta e chave.

Meus prompts são usados para treinar o modelo?

Não. Nossa política de privacidade é rigorosa. Os prompts que você envia para a API não são usados para o treinamento do modelo, garantindo a confidencialidade dos seus dados e conversas.

Posso usar esta API para conteúdo NSFW?

Sim, o modelo é feito para não censurar conteúdo adulto legal. No entanto, o conteúdo sexual envolvendo menores é sempre bloqueado, independentemente da jurisdição. Para o restante do conteúdo adulto, o modelo não oferece negações baseadas em conveniência.

Sua chave está a um passo

Crie uma conta, copie a chave e altere a URL base. Simples assim.

Obter chave de API