KO ▾
필터 없는 AI용 무검열 APIllmsincensura.com
$0.25입력 토큰 100만 개당
100,000토큰 컨텍스트 창
API 키 받기

홈가이드

앱에 IA Sin Filtro 통합하기

애플리케이션에 필터 없는 AI를 통합하면 대형 공급업체의 빈번한 거절 없이 모델로부터 직접적인 응답을 받을 수 있습니다. 이 기술 가이드는 OpenAI 호환 엔드포인트 연결, 컨텍스트 관리 및 스트리밍 처리 방법을 설명하여 원활하고 무검열된 사용자 경험을 구축하는 방법을 안내합니다.

무검열 AI란?

필터 없는 AI는 기업식 엄격한 정책이 아닌, 성인 콘텐츠, 논쟁거리, 니치 주제 등을 기준으로 거절하지 않도록 미세 조정 또는 설정된 대규모 언어 모델(LLM)을 의미합니다. 특정 패턴 감지 시 400 오류나 일반 텍스트를 반환할 수 있는 표준 상용 모델과 달리, 무검열 모델은 합법적인 경우 요청한 내용을 정확히 반환합니다.

이 기능은 창의성, 연구 또는 모델의 표현의 자유가 우선되는 환경에서 중요합니다. 모델이 '바보'이거나 지능이 부족하다는 뜻이 아닙니다. 단순히 때때로 유효한 응답을 차단하는 피상적인 검열 레이어를 제거하는 것입니다. 개발자에게는 외부 필터가 어떤 콘텐츠를 거부할지 예측할 필요가 없으므로 오류 처리 로직이 단순해집니다.

  • 예측 가능성: 임의적인 중단 없이 전체 텍스트를 얻습니다.
  • 제어: 콘텐츠를 표시할지 여부는 API가 아닌 당신이 결정합니다.
  • 효율성: 잘못된 검열로 인한 API 호출 실패가 줄어듭니다.

SDK 초기 설정

무검열 AI를 통합하려면 엔드포인트가 OpenAI 프로토콜과 100% 호환되므로 표준 OpenAI SDK를 사용합니다. Python의 openai나 Node.js의 openai과 같은 기존 라이브러리를 사용할 수 있습니다. 기본 URL과 API 키만 설정하면 됩니다.

이 접근 방식의 장점은 이식성입니다. 향후 호환 엔드포인트를 제공하는 다른 제공업체로 전환하더라도 코드 변경이 최소화됩니다. Python에서 우리 서비스에 연결하는 클라이언트 설정 방법은 다음과 같습니다:

from openai import OpenAI

client = OpenAI(base_url="https://api.llmsincensura.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

호환성은 동일한 JSON 요청 및 응답 형식을 사용한다는 의미로, 다른 플랫폼으로의 마이그레이션이나 표준 모킹을 사용한 단위 테스트 개발이 용이합니다.

API 키 인증

API 보안은 계정당 단일 API 키로 관리됩니다. 이 키는 등록 직후 생성되며 한 번 표시됩니다. 기본적으로 여러 키가 존재하지 않으며, 계정은 요청을 위한 주요 식별자를 가집니다.

액세스를 취소하거나 보안을 위해 새 토큰을 생성해야 하면 계정 설정에서 API 키를 재생성할 수 있습니다. 이 작업은 이전 키를 즉시 무효화합니다. 이는 속도 제한을 늘리는 방법이 아니라 활성 제어 지점을 하나만 유지하기 위한 보안 조치입니다. 키를 환경 변수에 저장하고 공개 앱의 클라이언트 코드에 노출하지 마세요.

  • 생성: 등록 시 표시됩니다.
  • 재생성: 이전 키를 무효화합니다.
  • 사용: Authorization: Bearer YOUR_KEY 헤더에 전송됩니다.

첫 번째 요청 보내기

기본 작업은 /v1/chat/completions으로 POST 요청을 보내는 것입니다. 모델을 uncensored로 지정하고, 필요시 톤을 설정하기 위해 시스템 프롬프트를 정의하며, 메시지 기록이나 사용자 쿼리를 제공해야 합니다. 모델은 입력을 처리하고 JSON 형식으로 전체 응답을 반환합니다.

이것은 통합이 제대로 작동하는지 검증하는 가장 간단한 흐름입니다. 생성된 콘텐츠와 소비된 토큰 수와 같은 사용 메타데이터를 포함하여 모델 응답을 적절히 처리하세요.

curl https://api.llmsincensura.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

이 요청은 채팅, 콘텐츠 생성 또는 텍스트 분석 앱의 기초입니다. 모델이 올바르게 응답하면 네트워크 설정과 인증이 올바릅니다.

스트리밍 처리

채팅봇과 같은 상호작용형 애플리케이션에서는 스트리밍이 중요합니다. 이를 통해 토큰이 생성되는 대로 클라이언트에 전송되어 지연 시간 인식을 개선합니다. 당사는 이를 위해 Server-Sent Events(SSE)를 지원합니다.

SDK에서 스트리밍을 활성화하면 여러 부분 이벤트를 받게 됩니다. 전체 응답을 구성하려면 이러한 조각을 연결해야 합니다. 모델이 긴 텍스트를 생성할 때 특히 유용하며, 사용자가 거의 즉시 텍스트를 볼 수 있습니다.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

스트리밍은 비스트리밍 요청보다 더 많은 토큰을 소비하지 않습니다. 데이터 전송 방식만 바뀝니다. 이는 AI에 의존하는 모든 현대적 UI에 권장되는 관행입니다.

100k 컨텍스트 관리

LLM 개발에서 가장 큰 과제 중 하나는 컨텍스트 한도입니다. 당사는 100,000개의 토큰 컨텍스트 창을 제공합니다. 이는 긴 문서, 긴 대화 기록 또는 큰 지식베이스를 단일 요청으로 로드하기에 충분합니다.

이를 효율적으로 활용하려면 슬라이딩 윈도우를 관리해야 합니다. 대화가 길어지면 모델에 전송하는 기록에서 가장 오래된 메시지를 제거하여 한도 내에 머물 수 있습니다. 컨텍스트에는 입력(프롬프트) 토큰과 출력(완성) 토큰이 모두 포함됩니다.

  • 용량: 총 100k 토큰.
  • 전략: 메시지에는 원형 버퍼를 구현하세요.
  • 비용: 토큰은 사용량에 따라 청구되므로 불필요한 컨텍스트 전송을 최적화하세요.

함수 호출 사용

함수(tool calling)를 사용하면 모델이 외부 코드와 상호작용할 수 있습니다. get_weather 또는 search_database과 같은 함수를 정의하고 모델이 호출할 구조화된 인수를 반환할 수 있습니다. 이는 실시간 데이터나 특정 작업이 필요한 애플리케이션에 필수적입니다.

우리의 무검열 AI는 OpenAI 표준과 동일한 방식으로 함수 호출을 지원합니다. tools 매개변수에 도구를 정의하고 모델이 호출 ID를 응답합니다. 귀하의 코드가 함수를 실행한 후 해당 데이터를 기반으로 최종 응답을 생성하기 위해 결과를 모델로 다시 전송합니다.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmsincensura.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

이 접근 방식은 수동적인 언어 모델을 애플리케이션에서 복잡한 작업을 수행할 수 있는 능동적인 에이전트로 전환합니다.

한도 및 할당량

서비스 안정성을 보장하기 위해 API에는 속도 제한과 크기 제한이 있습니다. 각 API 키는 분당 300개의 요청으로 제한됩니다. 이는 대부분의 중규모 애플리케이션에 충분하지만, 트래픽 피크가 있는 경우 요청 큐를 구현하는 것을 고려해야 합니다.

또한 요청 본문은 8 MB를 초과해서는 안 됩니다. 이는 단일 요청에서 전송할 수 있는 텍스트 또는 JSON 파일의 크기를 제한합니다. 더 많은 데이터를 전송해야 하는 경우 여러 요청으로 나누거나 전송 전에 요약하는 것을 고려하세요.

리소스한도
속도300 req/min
요청 크기8 MB
모델무검열

청구 및 충전

가격 모델은 종량제이며 월 구독이 의무화되지 않습니다. 토큰 100만 개당 청구됩니다. 입력 토큰 1M당 $0.25, 출력 토큰 1M당 $1.00입니다. 이 구조는 투명하고 예측 가능합니다.

암호화폐(USDT 또는 USDC)로 최소 $10를 충전하여 계정을 충전할 수 있습니다. 더 큰 금액을 충전하면 보너스를 받습니다: $50 이상 충전 시 5%, $100 이상 충전 시 10% 추가 크레딧을 받습니다. 크레딧은 만료되지 않으므로 시간 압박 없이 필요할 때 사용할 수 있습니다.

  • 입력 가격: $0.25 / 1M 토큰.
  • 출력 가격: $1.00 / 1M 토큰.
  • 보너스: $50 이상 +5%, $100 이상 +10%.

자주 묻는 질문

이 모델이 GPT나 Claude의 복제본입니까?

아니요. 이는 자체 GPU 서버에서 실행되는 오픈 웨이트 모델로, 무검열을 위해 특별히 미세 조정되었습니다. GPT, Claude, Gemini 또는 기타 외부 공급사의 모델이 아니지만 API 형식은 호환됩니다.

분당 300개 요청 한도를 초과하면 어떻게 됩니까?

API는 속도 제한(rate limit) 오류를 반환합니다. 카운터가 재설정될 때까지 기다리거나 애플리케이션에 지수 백오프 재시도 로직을 구현해야 합니다. 키를 재생성해도 이 한도가 증가하지 않습니다. 이는 계정 및 키당 제한이기 때문입니다.

프롬프트가 모델 학습에 사용됩니까?

아니요. 당사 개인정보 보호 정책은 엄격합니다. API에 전송한 프롬프트는 모델 학습에 사용되지 않으므로 데이터와 대화의 기밀성이 보장됩니다.

이 API를 NSFW 콘텐츠에 사용할 수 있습니까?

네, 이 모델은 합법적인 성인 콘텐츠에 대해 검열하지 않도록 설계되었습니다. 하지만 미성년자가 관련된 성 콘텐츠는 관할권에 관계없이 항상 차단됩니다. 나머지 성인 콘텐츠의 경우 모델은 편의에 따른 거절을 제공하지 않습니다.

키가 한 단계 앞에 있습니다

계정을 생성하고 키를 복사한 후 기본 URL을 변경하세요. 매우 간단합니다.

API 키 받기