FAQ API dużych modeli: znajdź odpowiedzi tematycznie
Dla deweloperów początkujących w API dużych modeli pojawia się wiele pytań: skąd wziąć klucz, czy można przesyłać obrazy, czy usługa może nagle zniknąć, jaka jest długość promptu. Pytania podzielono na pięć grup z krótkimi odpowiedziami i linkami do artykułów. Możesz przeskoczyć do interesującej Cię grupy.
Zaktualizowano
Kluczowe informacje
- Rejestracja przez e-mail i hasło, klucz API wyświetlany natychmiastowo. Jeden kontener, jeden klucz API, możliwość wygenerowania go ponownie.
- Zakres to czysta konwersacja tekstowa jednym modelem. Wspierane: strumieniowanie i wywoływanie funkcji. Brak obrazów, audio, wektorów i fine-tuning.
- Łącznie prompt i output to max 100,000 tokenów. Limit zapytań to 300 na minutę na klucz.
- Legalne treści dla dorosłych są dozwolone, ale treści seksualne z udziałem małoletnich są blokowane. Usługa tylko dla dorosłych.
Konta i klucze API
Jak uzyskać pierwszy klucz API?
Przejdź do strony kluczy API, zarejestruj się za pomocą adresu e-mail i hasła. Po zakończeniu rejestracji klucz zostanie wyświetlony automatycznie — nie musisz podawać danych do płatności.
Czy jedno konto może mieć wiele kluczy?
Nie, jeden klucz na konto. Aby rozdzielać zużycie między projekty, oznaczaj zapytania w swoim backendzie, a nie poprzez tworzenie wielu kluczy.
Co zrobić, jeśli klucz wycieknie?
Wygeneruj klucz ponownie natychmiast. Stary klucz traci ważność w momencie regeneracji. Wdróż nowy klucz, zanim go odwołasz.
Czy nowi użytkownicy mogą przetestować usługę?
Tak. Nowe konto otrzymuje $0.50 kredytu próbnego ważnego przez 7 dni. Nie wymaga to podania metody płatności.
Jeśli chcesz zobaczyć cały proces od rejestracji do wysłania pierwszego zapytania, przejdź przez pełną konfigurację projektu opisaną w artykule Chatbot.
Jeśli zarządzasz wieloma projektami, nie polegaj na wielu kluczach. Dodawaj znaczniki projektowe w backendzie i zapisuj usage. Pozwoli to na precyzyjne raportowanie miesięczne.
Co można, a czego nie można wywołać
Jaki jest adres endpointu i nazwa modelu?
Endpoint to https://api.apidamoxing.com/v1,模型名固定为 uncensored. Usługa obsługuje tylko jeden model.
Jakie endpointy są dostępne?
Dwa: POST /v1/chat/completions do konwersacji i GET /v1/models do listy modeli. Inne ścieżki zwrócą 404.
Czy można przesyłać obrazy, audio lub wyszukiwać wektorowo?
Nie. Obsługujemy tylko tekst. Brak obrazów, audio, wideo, wektorów i fine-tuning.
Czy wspierane jest strumieniowanie i wywoływanie funkcji?
Tak. Strumieniowanie włączasz przez stream: true (zwraca SSE). Wywoływanie funkcji używa formatu OpenAI tools.
Czy mogę użyć gotowego SDK OpenAI?
Tak. Ustaw base_url na powyższy adres, a api_key na swój klucz. Działa z Python, Node.js lub curl.
Częstym błędem jest myślenie, że kompatybilność z formatem OpenAI oznacza pełną zgodność funkcji. Tutaj jest tylko konwersacja tekstowa. Kod obsługujący obrazy, transkrypcję czy wektory trzeba zmienić.
Długość, częstotliwość i parametry
Ile treści zmieści się w jednym zapytaniu?
Łącznie input i output to max 100,000 tokenów. Limit rozmiaru ciała zapytania to 8 MB, ale w tekstach limit tokenów jest szybszy.
Dlaczego odpowiedź jest ucinana w połowie?
Zazwyczaj osiągasz limit max_tokens (domyślnie 2048). Zwiększ go, ale pamiętaj o limicie 32,000 i łącznym limicie 100,000 tokenów.
Ile zapytań można wysyłać na minutę?
300 na klucz. W zadaniach batch zalecamy ustawienie własnego limitu zapytań po stronie klienta, aby uniknąć konieczności reagowania po otrzymaniu limitu zapytań.
Czy pola temperature, top_p i stop są obsługiwane?
Tak. Te standardowe pola próbkowania są przekazywane do modelu bez zmian, zgodnie z oczekiwaniami przy użyciu endpointu chat completions.
Gdzie znajdziesz szczegółowe informacje o każdym polu?
Szczegółowy opis parametrów endpointu znajdziesz w dokumentacji parametrów, a stronie dokumentacji zawiera zwięzłe odniesienie.
Co oznacza „długi tekst”? 100 000 tokenów to około kilkunastu tysięcy znaków w języku chińskim, w zależności od treści — jest to przybliżona wielkość, a nie dokładny przelicznik. Przy pracy z bardzo długimi dokumentami zalecamy podział na fragmenty i ich późniejsze podsumowanie.
Koszty i stan konta
Jakie są stawki?
Rozliczanie za tokeny: 0,25 USD za milion tokenów wejściowych, 1,00 USD za milion tokenów wyjściowych. Brak opłat miesięcznych i subskrypcji.
Czy płatność jest z góry, czy z góry?
Z góry. Doładuj konto kredytem przedpłaconym i pobieraj środki w miarę zużycia. Stan konta nie wygasa.
Co się stanie, gdy zabraknie środków?
Zapytanie zakończy się niepowodzeniem ze statusem 402 i kodem błędu no_credit. Ten sam wynik zwracany jest przy wygaśnięciu darmowego kredytu próbnego. Po doładowaniu konta usługa wraca do normy.
Jak oszacować koszt danej funkcji?
Odniesij się do przykładów w sekcji tokeny i rozliczenia. Kluczowe jest odczytanie pola usage z odpowiedzi i pomnożenie go przez stawkę jednostkową.
Dodatkowa rada budżetowa: doładuj konto kwotą odpowiadającą „przewidywanemu zużyciu w tym okresie”. Nie musisz doładowywać zbyt dużej kwoty jednorazowo. Ponieważ jest to kredyt przedpłacony, stan konta stanowi Twój twardy limit — po jego wyczerpaniu usługa się zatrzymuje, bez niespodziewanych rachunków.
Praktyczne kwestie wdrożenia i debugowania
Czy można używać tego samego klucza API w środowisku deweloperskim i produkcyjnym?
Ponieważ jedno konto generuje tylko jeden klucz, w praktyce są one wspólne. Zawsze przechowuj klucz w zmiennych środowiskowych po stronie serwera, nie umieszczaj go w repozytoriach kodu ani na stronach frontendu. Pamiętaj, że wygenerowanie klucza ponownie unieważni go we wszystkich środowieniach jednocześnie.
Czy należy natychmiast wznowić próbę przy błędzie 503?
Nie. Oznacza to tymczasowe obciążenie usługi. Spróbuj ponownie po kilku sekundach i ustaw maksymalną liczbę prób. Intensywne wysyłanie zapytań tylko marnuje limit zapytań.
Endpoint działa wolno — czy coś jest nie tak?
Generowanie długiego tekstu wymaga czasu — im dłuższy output, tym dłużej trwa proces. Zalecamy włączenie strumieniowania, aby użytkownik widział tekst od razu, oraz ustawienie dłuższego czasu oczekiwania (timeout) po stronie klienta.
Jak uniknąć przekroczenia limitu przy długiej rozmowie?
Obcinaj historię rozmowy we własnym backendzie, zachowując tylko kilka ostatnich tur. Starsze wiadomości można skompresować do postaci streszczenia. Oszacuj całkowitą liczbę tokenów przed wysłaniem zapytania, a nie wtedy, gdy endpoint zwróci błąd 400.
Jak sprawdzić, ile tokenów zużyło konkretne zapytanie?
Przeczytaj pole usage w odpowiedzi. Zawiera ono dane o tokenach wejściowych, wyjściowych i łącznych. W odpowiedziach strumieniowych dane te są dostępne w ostatnim bloku danych, bez konieczności dodawania dodatkowych parametrów.
Te pytania powtarzają się, ponieważ dotyczą etapu następującego po „uruchomieniu kodu”. Traktuj tę sekcję jako listę kontrolną przed wdrożeniem i upewnij się, że Twój kod obsługuje wszystkie wymienione przypadki.
Zakres treści i osoby uprawnione
Jakie treści są odrzucane?
Legalna treść dla dorosłych, powieści i tematy kontrowersyjne nie są odrzucane. Treści o charakterze seksualnym z udziałem osób niepełnoletnich są zawsze blokowane i zwracają status 403, dotyczy to również powieści i odgrywania ról.
Kto może korzystać z usługi?
Wyłącznie osoby pełnoletnie (18+). Jeśli Twoja aplikacja jest publiczna, dodaj weryfikację wieku na stronie wejścia.
Czy moje prompty są wykorzystywane do trenowania modelu?
Nie, prompty nie są używane do trenowania.
Gdzie szukać informacji przy wystąpieniu błędu?
Najpierw przeczytaj pola code i message w obiekcie error w ciele odpowiedzi, a następnie skonsultuj się ze statusem HTTP: 401 oznacza problem z kluczem, 402 — stan konta, 403 — treść, 429 — limit zapytań, 503 — tymczasowe obciążenie usługi (spróbuj ponownie za kilka sekund).
Najczęściej zadawane pytania
Czego potrzebuję do wywołania endpointu?
Klucz z zarejestrowanego konta oraz zapytanie HTTPS do https://api.apidamoxing.com/v1 z nagłówkiem Bearer. Reszta formatu jest zgodna z endpointem chat completions.
Jakie funkcje są obsługiwane, a jakie nie?
Obsługiwane: rozmowy tekstowe, strumieniowanie i wywoływanie funkcji. Nieobsługiwane: obrazy, audio, wideo, wektory embedding i fine-tuning.
Dlaczego odpowiedź jest ucinana?
Zazwyczaj jest to przekroczenie limitu max_tokens (domyślnie 2048, można zwiększyć do 32 000). Łączna liczba tokenów w promptcie i outputcie nie może przekroczyć 100 000.
Co się stanie, gdy zabraknie środków?
Zapytanie zwraca kod 402 i no_credit. Po doładowaniu przedpłaconego kredytu można kontynuować pracę. Saldo nie wygasa.
Kto nie może korzystać z tej usługi?
Osoby poniżej 18. roku życia. Treści o charakterze seksualnym z udziałem osób niepełnoletnich są zawsze blokowane i zwracają status 403, niezależnie od tego, czy są fikcyjne, czy nie.
Wypełnij formularz, aby uzyskać klucz API
Utwórz konto, skopiuj klucz i zmień Base URL. Konfiguracja jest prosta.