API 문서: 무검열 OpenAI 호환 엔드포인트
몇 분 안에 무검열 OpenAI 호환 엔드포인트로 시작하세요. 표준 OpenAI SDK를 사용하여 텍스트를 보내고 예측 가능한 가격과 벤더 종속성 없이 제한 없는 응답을 받으세요.
Base URL 및 인증
API는 표준 OpenAI 인터페이스를 따르므로 통합이 간단합니다. 모든 요청에 Base URL https://api.uncensoredendpoint.com/v1을 사용하세요. 인증은 가입 시 생성된 단일 API 키에 의존합니다. 이 키를 Authorization 헤더에 Bearer 토큰으로 포함하세요. 각 계정에는 활성 키가 하나만 제한되며, 언제든지 재생성하여 접근 권한을 즉시 취소할 수 있습니다. 이 설정은 표준 OpenAI 호환 엔드포인트를 지원하는 모든 클라이언트에서 작동하여 독점적인 종속성을 피할 수 있습니다.
첫 번째 요청
인프라에서 호스팅된 무검열 LLM에 표준 채팅 완료 요청을 보내 테스트하세요. 모델 ID는 단순히 "uncensored"입니다. 이 엔드포인트는 합법적인 성인 콘텐츠, 창작물 또는 논쟁적인 주제에 대한 필터링을 제공하지 않아 제한 없는 사용에 깨끗한 출력을 제공합니다. 요청 본문당 최대 8 MB까지 전송할 수 있습니다. 클라이언트가 표준 JSON 응답 구조를 처리하도록 구성하세요.
curl https://api.uncensoredendpoint.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
응답에 생성된 텍스트가 포함되어 있는지 확인하세요. 오류가 발생하면 키 유효성 또는 계정 잔액을 확인하세요. 모델은 단일 요청 내에서 상당한 입력과 출력을 허용하는 100,000 토큰 컨텍스트 창으로 작동합니다.
Python SDK 통합
공식 OpenAI Python 라이브러리를 사용하여 API와 상호 작용하세요. 클라이언트를 특정 Base URL 및 API 키로 구성하세요. 라이브러리는 직렬화 및 오류 구문을 자동으로 처리합니다. 이 방법은 신뢰할 수 있는 동기식 호출이 필요한 백엔드 서비스나 데이터 처리 파이프라인에 이상적입니다.
from openai import OpenAI
client = OpenAI(base_url="https://api.uncensoredendpoint.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
모델 ID를 "uncensored"로 설정해야 합니다. SDK는 HTTP 연결을 효율적으로 관리합니다. 특정 배포 환경에 맞게 시간 제한 및 재시도를 조정할 수 있습니다. 이 방법은 검증된 유지 관리 중인 클라이언트 라이브러리를 사용함을 보장합니다.
Node SDK 통합
Node.js OpenAI SDK는 Python 버전과 동일하게 작동합니다. Base URL 및 키로 클라이언트를 초기화하세요. 이는 JavaScript 환경에서의 서버 측 렌더링 또는 API 게이트웨이에 유용합니다. 패키지는 스트리밍 처리 및 JSON 구문을 기본적으로 처리합니다.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.uncensoredendpoint.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
모델 매개변수를 "uncensored"로 설정하세요. SDK는 완료 데이터를 포함하는 응답 객체를 반환합니다. 이를 Express 라우트 또는 다른 Node.js 프레임워크에 직접 통합할 수 있습니다. 선택한 SDK에 필요한 Node.js 버전을 지원하는지 확인하세요.
스트리밍 응답
stream 매개변수를 true로 설정하여 스트리밍을 활성화하세요. API는 단일 JSON 객체가 아닌 Server-Sent Events (SSE) 스트림을 반환합니다. 이를 통해 생성되는 텍스트 토큰을 표시하여 최종 사용자의 지각된 지연 시간을 개선할 수 있습니다. 스트림의 각 이벤트에는 응답의 부분 청크가 포함됩니다.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
각 SSE 이벤트를 구문 분석하여 델타 내용을 추출하세요. 이는 사용자가 실시간 타이핑 효과를 기대하는 채팅 인터페이스에 중요합니다. 무검열 OpenAI 호환 엔드포인트는 이 표준 스트리밍 동작을 지원하여 대부분의 현대 웹 클라이언트와 호환성을 보장합니다.
속도 제한 및 제약 사항
각 API 키는 분당 300개의 요청으로 제한됩니다. 이 한도를 초과하면 API는 속도 제한을 나타내는 429 상태 코드를 반환합니다. 최대 요청 본문 크기는 8 MB입니다. 키가 유효하지 않은 경우와 같은 인증 오류의 경우 401 상태를 받게 됩니다. 선불 크레따 문제가 발생할 수 있지만, 결제 상태에 대한 특정 HTTP 코드는 모든 클라이언트 구현에서 일관되게 보장되지 않습니다.
컨텍스트 창은 프롬프트와 완료의 합계로 100,000 토큰입니다. 이는 엄격한 제한이며 이를 초과하면 오류가 발생합니다. SLA 또는 가동 시간 보장은 제공되지 않습니다. 이 서비스는 복잡한 라우팅이나 다중 모델 집계 없이 단순하고 대용량 사용을 위해 설계되었습니다.
API 사양
크레딧을 구매하기 전에 확인할 수 있도록 API의 실제 한도와 기능을 한곳에 정리했습니다.
| 항목 | 내용 |
|---|---|
| 형식 | OpenAI 호환: 어떤 OpenAI SDK든 base URL과 키만 바꾸면 동작 |
| 엔드포인트 | POST /v1/chat/completions · GET /v1/models |
| 모델 ID | uncensored |
| 인증 | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.uncensoredendpoint.com/v1 |
| 컨텍스트 창 | 100,000 토큰 (입력 + 출력) |
| 스트리밍 | 지원 — SSE, 마지막 청크에 토큰 사용량 포함 |
| 파라미터 | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| 함수 호출 | 지원 — tools, tool_choice; 응답에 tool_calls (스트리밍 포함), 결과는 role: tool로 전송 |
| 최대 출력 | 100,000 토큰 윈도우의 남은 만큼; max_tokens는 선택 사항(별도 상한 없음) |
| JSON 모드 | response_format: {"type": "json_object"} |
| 요청 크기 | 최대 8 MB |
| 속도 제한 | 키당 분당 300회 |
| 응답 헤더 | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| 동시 요청 | 키당 동시 8개 |
| 무료 체험 | $0.50, 7일, 카드 불필요 · 체험 키: 동시 요청 2건, 분당 60건. 첫 충전 후 전체 한도(8건, 300건) 적용 |
| 과금 | 선불 크레딧에서 실제 사용량만큼 차감, 오류·거부는 무료 |
| 유효기간 | 유료 크레딧은 만료되지 않으며 구독 없음 |
| 충전 | USDT (TRC20) 또는 USDC (Base), $10~$500 사이 원하는 정수 금액 |
| 가격 | 입력 100만 토큰당 $0.25 · 출력 100만 토큰당 $1.00 |
| 보너스 | $50 이상 +5%, $100 이상 +10% |
| 로그인 | Google 또는 이메일과 비밀번호 |
| 키 | 계정당 활성 키 1개, 새 키를 만들면 이전 키는 무효 |
| 콘텐츠 | 성인 콘텐츠 허용, 미성년자가 관련된 성적 콘텐츠는 거부 |
오류 코드
오류는 고정된 type을 가진 JSON으로 반환되며, 실패하거나 거부된 요청은 과금되지 않습니다.
| 코드 | 유형 | 의미 |
|---|---|---|
400 | bad_request | 잘못된 JSON, 빈 메시지, 잘못된 파라미터 또는 컨텍스트 초과 |
401 | missing_key · invalid_key · key_revoked | 키 없음·잘못됨·새 키로 교체됨 |
402 | no_credit | 잔액 없음 — 충전하면 즉시 재개 |
403 | content_blocked | 미성년자 관련 성적 콘텐츠 — 거부, 과금 없음 |
404 | not_found | 알 수 없는 엔드포인트 |
413 | request_too_large | 본문 8 MB 초과 |
429 | rate_limited · concurrency | 분당 300회 또는 동시 8개 초과 — 잠시 후 재시도 |
503 | upstream_busy | 모델 혼잡 — 몇 초 후 재시도 |
질문과 답변
무검열 AI API 키는 특정 모델 버전에 연결되나요?
네, 키는 "uncensored" 모델 ID 전용으로 작동합니다. 이는 여러 벤더 간 라우팅 서비스가 아닌 자체 GPU 서버에서 실행되는 단일 오픈 웨이트 모델입니다. 모델 버전 관리를 수동으로 수행할 필요가 없습니다.
컨텍스트 창은 어떻게 작동하나요?
100,000 토큰 제한은 입력 프롬프트와 생성된 출력의 합계에 적용됩니다. 결합된 토큰 수가 이 한도를 초과하면 요청이 실패합니다. 이를 통해 단일 API 호출에서 큰 문서나 긴 대화 기록을 처리할 수 있습니다.
이 엔드포인트를 함수 호출에 사용할 수 있나요?
네, chat-completions 엔드포인트는 도구 및 함수 호출을 지원합니다. 요청에서 도구를 정의하면 모델이 적절한 경우 구조화된 JSON 출력을 반환합니다. 이는 표준 OpenAI 호환 클라이언트 라이브러리에서 작동합니다.
키는 양식 하나만 작성하면 받을 수 있습니다
계정을 생성하고 키를 복사한 후 Base URL을 변경하세요. 설정은 이것뿐입니다.