Trang chủHướng dẫn
Cách tích hợp AI Không kiểm duyệt vào ứng dụng của bạn
Cập nhật LLM Sin Censura
Tích hợp AI không kiểm duyệt vào ứng dụng của bạn cho phép bạn nhận phản hồi trực tiếp từ mô hình mà không có các từ chối thường xuyên từ các nhà cung cấp lớn. Hướng dẫn kỹ thuật này giải thích cách kết nối một endpoint tương thích với OpenAI, quản lý ngữ cảnh và xử lý truyền phát để xây dựng trải nghiệm người dùng mượt mà và không kiểm duyệt.
AI Không kiểm duyệt là gì?
AI không kiểm duyệt đề cập đến mô hình ngôn ngữ lớn (LLM) đã được tinh chỉnh hoặc cấu hình để không từ chối nội dung người lớn, tranh cãi hoặc các chủ đề ngách dựa trên các chính sách doanh nghiệp cứng nhắc. Không giống như các mô hình thương mại tiêu chuẩn có thể trả về lỗi 400 hoặc văn bản chung chung khi phát hiện các mẫu nhất định, mô hình không kiểm duyệt trả về chính xác những gì bạn yêu cầu, miễn là nó hợp pháp.
Tính năng này rất quan trọng cho các ứng dụng sáng tạo, nghiên cứu hoặc môi trường nơi tự do ngôn luận của mô hình là ưu tiên hàng đầu. Điều này không có nghĩa là mô hình 'ngu ngốc' hoặc thiếu trí thông minh; nó chỉ loại bỏ các lớp kiểm duyệt bề mặt đôi khi chặn các phản hồi hợp lệ. Đối với nhà phát triển, điều này đơn giản hóa logic xử lý lỗi vì bạn không cần phải dự đoán nội dung nào sẽ bị chặn bởi bộ lọc bên ngoài.
- Khả năng dự đoán: Bạn nhận được văn bản đầy đủ mà không bị cắt ngang tùy tiện.
- Kiểm soát: Bạn quyết định nội dung nào được hiển thị, không phải API.
- Hiệu quả: Ít yêu cầu API thất bại hơn do kiểm duyệt sai.
Cấu hình SDK ban đầu
Để tích hợp AI không kiểm duyệt của chúng tôi, chúng tôi sẽ sử dụng SDK tiêu chuẩn của OpenAI, vì endpoint của chúng tôi tương thích 100% với giao thức của họ. Điều này cho phép bạn sử dụng các thư viện quen thuộc như openai trong Python hoặc openai trong Node.js. Bạn chỉ cần điều chỉnh URL cơ sở và cung cấp khóa API của mình.
Lợi thế của cách tiếp cận này là tính di động. Nếu trong tương lai bạn quyết định chuyển sang nhà cung cấp khác cũng cung cấp endpoint tương thích, việc thay đổi mã của bạn sẽ rất tối thiểu. Dưới đây là cách cấu hình khách hàng trong Python trỏ đến dịch vụ của chúng tôi:
from openai import OpenAI
client = OpenAI(base_url="https://api.llmsincensura.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Hãy nhớ rằng tính tương thích có nghĩa là chúng tôi sử dụng cùng định dạng yêu cầu và phản hồi JSON, giúp dễ dàng di chuyển từ các nền tảng khác hoặc phát triển các bài kiểm tra đơn vị bằng cách sử dụng các mock tiêu chuẩn.
Xác thực bằng API Key
Bảo mật trong API của chúng tôi được quản lý bằng một khóa API duy nhất cho mỗi tài khoản. Khóa này được tạo ngay sau khi đăng ký và được hiển thị một lần. Quan trọng là phải hiểu rằng không có nhiều khóa theo mặc định; tài khoản của bạn có một định danh chính cho các yêu cầu của bạn.
Nếu bạn cần thu hồi quyền truy cập hoặc tạo token mới vì lý do bảo mật, bạn có thể tạo lại khóa của mình trong cài đặt tài khoản. Lưu ý rằng điều này vô hiệu hóa khóa trước đó ngay lập tức. Đây không phải là cách để tăng giới hạn tốc độ của bạn, mà là một biện pháp bảo mật để chỉ có một điểm kiểm soát hoạt động. Hãy lưu khóa của bạn trong các biến môi trường và không bao giờ để lộ nó trong mã phía máy khách nếu ứng dụng của bạn là công khai.
- Tạo: Được hiển thị khi bạn đăng ký.
- Tạo lại: Vô hiệu hóa khóa trước đó.
- Sử dụng: Được gửi trong tiêu đề
Authorization: Bearer YOUR_KEY.
Gửi yêu cầu đầu tiên
Thao tác cơ bản là yêu cầu POST đến /v1/chat/completions. Bạn phải chỉ định mô hình là uncensored, xác định prompt hệ thống nếu cần để thiết lập tông giọng, và cung cấp lịch sử tin nhắn hoặc truy vấn đơn giản của người dùng. Mô hình sẽ xử lý đầu vào và trả về phản hồi đầy đủ dưới dạng JSON.
Đây là luồng đơn giản nhất để xác minh rằng tích hợp của bạn đang hoạt động. Đảm bảo rằng ứng dụng của bạn xử lý đúng các phản hồi của mô hình, bao gồm nội dung được tạo và siêu dữ liệu sử dụng, như số token đã tiêu thụ.
curl https://api.llmsincensura.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Yêu cầu này là nền tảng cho bất kỳ ứng dụng trò chuyện, tạo nội dung hoặc phân tích văn bản nào. Nếu mô hình phản hồi đúng, cấu hình mạng và xác thực của bạn là chính xác.
Xử lý truyền phát
Đối với các ứng dụng tương tác như chatbot, việc sử dụng truyền phát là rất quan trọng. Điều này cho phép các token được gửi đến máy khách khi chúng được tạo, cải thiện nhận thức về độ trễ. API của chúng tôi hỗ trợ Server-Sent Events (SSE) cho mục đích này.
Khi bật truyền phát trong SDK của bạn, bạn sẽ nhận được nhiều sự kiện từng phần. Bạn phải nối các đoạn này lại để xây dựng phản hồi đầy đủ. Điều này đặc biệt hữu ích khi mô hình tạo văn bản dài, vì người dùng bắt đầu xem văn bản gần như ngay lập tức.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Truyền phát không tiêu tốn nhiều token hơn một yêu cầu không truyền phát; nó chỉ thay đổi cách dữ liệu được vận chuyển. Đây là thực hành được khuyến nghị cho bất kỳ giao diện người dùng hiện đại nào dựa trên AI.
Quản lý ngữ cảnh 100k
Một trong những thách thức lớn nhất trong phát triển LLM là giới hạn ngữ cảnh. API của chúng tôi cung cấp cửa sổ ngữ cảnh 100.000 token. Điều này đủ để tải các tài liệu mở rộng, lịch sử cuộc trò chuyện dài hoặc cơ sở kiến thức lớn trong một yêu cầu duy nhất.
Để tận dụng điều này một cách hiệu quả, bạn phải quản lý cửa sổ trượt trong ứng dụng của mình. Khi cuộc trò chuyện phát triển, bạn có thể loại bỏ các tin nhắn cũ nhất khỏi lịch sử bạn gửi đến mô hình để duy trì trong giới hạn. Ngữ cảnh bao gồm cả token đầu vào (prompt) và token đầu ra (completion).
- Khả năng: 100k token tổng cộng.
- Chiến lược: Triển khai bộ đệm vòng cho các tin nhắn.
- Chi phí: Token được tính phí theo mức sử dụng, vì vậy bạn nên tối ưu hóa việc gửi ngữ cảnh không cần thiết.
Sử dụng gọi hàm
Các hàm (gọi hàm) cho phép mô hình tương tác với mã của bạn. Bạn có thể định nghĩa các hàm như get_weather hoặc search_database và mô hình sẽ trả về một đối số có cấu trúc để gọi chúng. Điều này rất quan trọng cho các ứng dụng cần dữ liệu thời gian thực hoặc các hành động cụ thể.
AI không kiểm duyệt của chúng tôi hỗ trợ gọi hàm theo cách tương tự như chuẩn OpenAI. Bạn xác định các công cụ trong tham số tools và mô hình sẽ trả về một ID lệnh gọi. Mã của bạn sẽ thực thi hàm và sau đó gửi kết quả lại cho mô hình để tạo câu trả lời cuối cùng dựa trên dữ liệu đó.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmsincensura.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Cách tiếp cận này biến một mô hình ngôn ngữ thụ động thành một tác tử chủ động có khả năng thực hiện các nhiệm vụ phức tạp trong ứng dụng của bạn.
Giới hạn và Hạn mức
Để đảm bảo tính ổn định của dịch vụ, API của chúng tôi có các giới hạn về tốc độ và kích thước. Mỗi khóa API bị giới hạn ở 300 yêu cầu mỗi phút. Điều này là đủ cho hầu hết các ứng dụng sử dụng ở mức trung bình, nhưng nếu ứng dụng của bạn có các đỉnh lưu lượng cao, bạn nên cân nhắc triển khai hàng đợi yêu cầu ở phía bạn.
Ngoài ra, nội dung yêu cầu không được vượt quá 8 MB. Điều này giới hạn kích thước của các tệp văn bản hoặc JSON mà bạn có thể gửi trong một yêu cầu đơn lẻ. Nếu bạn cần gửi nhiều dữ liệu hơn, hãy cân nhắc chia nhỏ thành nhiều yêu cầu hoặc tóm tắt trước khi gửi.
| Tài nguyên | Giới hạn |
|---|---|
| Tốc độ | 300 req/phút |
| Kích thước Request | 8 MB |
| Mô hình | không kiểm duyệt |
Thanh toán và Nạp tiền
Mô hình giá là trả theo mức sử dụng, không có gói đăng ký hàng tháng bắt buộc. Bạn sẽ được tính phí theo mỗi triệu token. Chi phí là $0.25 cho 1M token đầu vào và $1.00 cho 1M token đầu ra. Cấu trúc này minh bạch và dễ dự đoán.
Bạn có thể nạp tiền vào tài khoản của mình với số tiền tối thiểu là $10 bằng tiền điện tử (USDT hoặc USDC). Nếu bạn nạp các khoản lớn hơn, bạn sẽ nhận được khoản bổ sung: thêm 5% cho các khoản nạp từ $50 trở lên và thêm 10% cho các khoản nạp từ $100 trở lên. Tín dụng không hết hạn, vì vậy bạn có thể sử dụng khi cần mà không bị áp lực về thời gian.
- Giá token đầu vào: $0.25 / 1 triệu token.
- Giá token đầu ra: $1.00 / 1 triệu token.
- Khoản bổ sung: +5% từ $50, +10% từ $100.
Câu hỏi thường gặp
Mô hình này có phải là bản sao của GPT hay Claude không?
Không. Đây là một mô hình trọng số mở (open-weight) được chạy trên các máy chủ GPU của riêng chúng tôi, được tinh chỉnh đặc biệt để không kiểm duyệt. Nó không phải là GPT, Claude, Gemini hay bất kỳ mô hình nào từ nhà cung cấp bên ngoài, mặc dù nó tương thích với định dạng API của chúng.
Sẽ xảy ra gì nếu tôi vượt quá giới hạn 300 yêu cầu mỗi phút?
API sẽ trả về lỗi giới hạn tốc độ (rate limit). Bạn sẽ phải đợi bộ đếm được đặt lại hoặc triển khai logic thử lại với cơ chế giảm dần theo cấp số nhân trong ứng dụng của mình. Tạo lại khóa của bạn không làm tăng giới hạn này, vì giới hạn này dựa trên tài khoản và khóa.
Các prompt của tôi có được sử dụng để huấn luyện mô hình không?
Không. Chính sách bảo mật của chúng tôi rất nghiêm ngặt. Các prompt bạn gửi đến API không được sử dụng để huấn luyện mô hình, đảm bảo tính bảo mật cho dữ liệu và cuộc trò chuyện của bạn.
Tôi có thể sử dụng API này cho nội dung NSFW không?
Đúng vậy, mô hình được thiết kế để không kiểm duyệt nội dung người lớn hợp pháp. Tuy nhiên, nội dung tình dục liên quan đến trẻ vị thành niên luôn bị chặn, bất kể luật pháp địa phương. Đối với các nội dung người lớn khác, mô hình không từ chối dựa trên sự tiện lợi.
Khóa của bạn chỉ còn một bước
Tạo tài khoản, sao chép khóa và thay đổi URL cơ sở. Dễ dàng như vậy.
Lấy khóa API