Häufig gestellte Fragen zur LLM-API: Antworten nach Themen
Wenn du zum ersten Mal mit der LLM-API arbeitst, tauchen viele Fragen auf: Woher bekomme ich den Schlüssel? Kann ich Bilder senden? Wird der Dienst plötzlich abgeschaltet? Wie lang darf der Text sein? Wir haben die Fragen in fünf Themenbereiche gruppiert. Die Antworten sind kurz und prägnant. Bei Bedarf verlinken wir zu weiterführenden Artikeln. Springe direkt zu deiner Frage.
Aktualisiert am
Wichtige Punkte
- Der Zugang erfolgt über E-Mail und Passwort. Der Schlüssel wird sofort angezeigt. Pro Konto gibt es genau einen Schlüssel, der neu generiert werden kann.
- Der Dienst unterstützt nur Textdialoge mit einem einzigen Modell. Streaming und Function Calling sind verfügbar. Keine Bilder, Audio, Vektoren oder Fine-Tuning.
- Die Summe aus Prompt und Ausgabe einer einzelnen Anfrage darf 100.000 Token nicht überschreiten. Pro Schlüssel sind 300 Anfragen pro Minute erlaubt.
- Legale erwachsene Inhalte sind erlaubt. Sexuelle Inhalte, die Minderjährige betreffen, werden jedoch blockiert. Der Dienst richtet sich ausschließlich an Erwachsene.
Konto & Schlüssel
Wie bekomme ich meinen ersten API-Schlüssel?
Besuche die Seite zum Erhalten des Schlüssels. Registriere dich mit E-Mail und Passwort. Nach der Registrierung wird der Schlüssel angezeigt. Keine Zahlungsinformationen sind erforderlich.
Kann ich mehrere API-Schlüssel pro Konto erstellen?
Nein. Pro Konto gibt es nur einen Schlüssel. Um den Verbrauch für verschiedene Projekte zu trennen, nutze Tags in deinem Backend statt mehrerer Schlüssel.
Was passiert, wenn mein API-Schlüssel verloren geht?
Generiere den Schlüssel sofort neu. Der alte Schlüssel wird ab diesem Moment ungültig. Bereite den neuen Wert an allen Stellen bereit, bevor du ihn aktivierst.
Kann ich die API zuerst testen?
Ja. Neue Konten erhalten $0,50 kostenloses Testguthaben, das 7 Tage gültig ist. Keine Zahlungsmethode wird benötigt.
Für den kompletten Weg von der Registrierung bis zur ersten Anfrage sieh dir das Projekt im Chatbot-Artikel an.
Wenn du mehrere Projekte verwaltest, verlasse dich nicht auf mehrere Schlüssel zur Isolierung. Füge deinem Backend stattdessen Projekt-Tags für jede Anfrage hinzu und speichere die Nutzungsdaten. So kannst du am Monatsende nach Tags aggregieren. Das ist übersichtlicher als jede grobe Statistik im Dashboard.
Funktionen: Was geht, was nicht
Wie lauten die URL und der Modellname?
Die URL ist https://api.apidamoxing.com/v1,模型名固定为 uncensored. Es gibt nur dieses eine Modell.
Welche Endpunkte werden angeboten?
Zwei: POST /v1/chat/completions für Dialoge und GET /v1/models zur Auflistung der Modelle. Andere Pfade geben 404 zurück.
Kann ich Bilder, Audio oder Vektoren senden?
Nein. Wir verarbeiten nur Text. Es gibt keine Bild-, Audio-, Video-, Vektor-Embedding- oder Fine-Tuning-Unterstützung.
Werden Streaming und Function Calling unterstützt?
Ja. Aktiviere Streaming mit stream: true im Request (SSE-Ausgabe). Function Calling nutzt das OpenAI tools-Format.
Kann ich das bestehende OpenAI SDK nutzen?
Ja. Ändere die base_url auf die oben genannte Adresse und setze deinen API-Schlüssel. Python, Node.js oder curl funktionieren.
Ein häufiger Irrtum: „Da das Format kompatibel ist, unterstützt es alle Funktionen von OpenAI.“ Die Kompatibilität betrifft nur Request- und Response-Formate. Da wir nur Textdialoge anbieten, musst du Code für Bildverständnis, Transkription oder Vektoren anpassen.
Länge, Ratenlimit & Parameter
Wie viel Inhalt passt in eine Anfrage?
Input und Output zusammen maximal 100.000 Token. Der Request-Body ist auf 8 MB begrenzt, aber das Token-Limit wird in Textszenarien meist zuerst erreicht.
Warum wird die Antwort mitten im Satz unterbrochen?
Meistens hast du das max_tokens-Limit erreicht (Standard: 2048). Erhöhe den Wert auf maximal 32.000. Achte darauf, dass die Gesamtzahl der Token 100.000 nicht überschreitet.
Wie viele Anfragen pro Minute sind möglich?
300 pro Schlüssel. Für Batch-Aufgaben solltest du die Anfragen auf deiner Seite vorrangig drosseln, statt erst zu reagieren, wenn das Ratenlimit erreicht ist.
Werden temperature, top_p und stop berücksichtigt?
Ja, diese Standard-Sampling-Parameter werden unverändert an das Modell übergeben. Das Verhalten entspricht genau deiner Erwartung beim Chat-Completion-Endpunkt.
Wo findest du Details zu jedem Parameter?
Im Detailübersicht der Schnittstellenparameter findest du eine Tabelle. Die Dokumentation bietet eine kompakte Referenz.
Was bedeutet „lang“? 100.000 Token entsprechen etwa einigen zehntausend chinesischen Zeichen, je nach Inhalt. Dies ist eine grobe Größenordnung, keine exakte Umrechnung. Bei sehr langen Dokumenten ist es ratsam, sie zuerst zu segmentieren und dann zusammenzufassen.
Kosten und Guthaben
Wie wird abgerechnet?
Token-basiert: 0,25 $ pro Million Input-Token, 1,00 $ pro Million Output-Token. Keine monatlichen Gebühren, kein Abo erforderlich.
Muss ich im Voraus oder im Nachhinein zahlen?
Im Voraus. Lade Prepaid-Guthaben auf dein Konto auf. Der Betrag wird verbrauchsabhängig abgezogen. Das Guthaben verfällt nie.
Was passiert, wenn das Guthaben aufgebraucht ist?
Die Anfrage schlägt mit dem Statuscode 402 und dem Fehlercode no_credit fehl. Das gleiche gilt für das abgelaufene kostenlose Testguthaben. Nach dem Aufladen des Guthabens ist der Dienst wieder verfügbar.
Wie schätze ich die Kosten für eine Funktion ab?
Siehe die Rechenbeispiele in Token und Abrechnung. Der Kern liegt darin, die usage-Felder in der Antwort zu lesen und mit dem Preis pro Token zu multiplizieren.
Ein weiterer Tipp zur Budgetplanung: Lade das Guthaben basierend auf der „vorhergesagten Nutzung“ in diesem Zeitraum auf. Du musst nicht auf einmal viel aufladen. Da es sich um Prepaid-Guthaben handelt, ist dein Guthaben die harte Obergrenze. Wenn es aufgebraucht ist, stoppt der Dienst, ohne dass unerwartete Rechnungen entstehen.
Praktische Fragen zu Deployment und Fehlerbehebung
Können Entwicklung und Produktivumgebung denselben Schlüssel verwenden?
Da ein Konto nur einen Schlüssel hat, wird dieser faktisch gemeinsam genutzt. Platziere den Schlüssel unbedingt in den Umgebungsvariablen des Servers, nicht im Code-Repository oder im Frontend. Beachte, dass das Neuerstellen des Schlüssels alle Umgebungen gleichzeitig ungültig macht.
Sollte ich bei einem 503-Fehler sofort erneut versuchen?
Nein. Das bedeutet, dass der Dienst vorübergehend ausgelastet ist. Warte einige Sekunden und versuche es erneut. Lege eine maximale Anzahl an Wiederholungen fest. Ständiges Senden von Anfragen verschwendet nur deine Anfragekontingente.
Die API-Aufrufe sind langsam. Ist etwas kaputt?
Die Generierung langer Texte dauert einfach länger. Je länger die Ausgabe, desto länger dauert es. Aktiviere das Streaming, damit der Nutzer die ersten Zeichen sofort sieht, und stelle das Client-Timeout etwas großzügiger ein.
Wie vermeide ich das Überschreiten des Limits bei langen Gesprächen?
Schneide die Historie auf deinem Backend ab und behalte nur die letzten paar Runden. Ältere Inhalte können zu einer Zusammenfassung komprimiert werden. Schätze die Gesamtmenge vor der Anfrage ab, statt erst auf den 400-Statuscode der API zu warten.
Wie stelle ich fest, wie viele Token eine bestimmte Anfrage verbraucht hat?
Lies das usage-Feld in der Antwort. Es enthält Input, Output und die Gesamtsumme. Bei Streaming-Antworten wird dieser Wert im letzten Datenpaket übermittelt. Es sind keine zusätzlichen Parameter erforderlich.
Diese Fragen tauchen immer wieder auf, weil sie genau in dem Schritt auftreten, der auf „der Code läuft“ folgt. Nutze diesen Abschnitt als Checkliste vor dem Deployment, um sicherzustellen, dass dein Programm für jeden Punkt eine entsprechende Behandlung vorsieht.
Inhaltsgrenzen und Zielgruppe
Welche Inhalte werden abgelehnt?
Reife Inhalte, Romane und kontroverse Themen werden nicht abgelehnt. Sexuelle Inhalte mit Minderjährigen werden stets blockiert und mit 403 zurückgegeben, ebenso Romane und Rollenspiele.
Wer kann den Dienst nutzen?
Nur Erwachsene ab 18 Jahren. Wenn dein Produkt für die Öffentlichkeit zugänglich ist, führe eine Altersüberprüfung an der Eintrittsschwelle durch.
Werden meine Prompts zum Training verwendet?
Nein, die Prompts werden nicht zum Training verwendet.
Wo schaue ich zuerst bei Fehlern nach?
Lies zuerst den code und die message im error-Objekt der Antwort und vergleiche sie mit dem Statuscode: 401 bedeutet ein Schlüsselproblem, 402 bedeutet Guthaben, 403 bedeutet Inhalt, 429 bedeutet Drosselung, 503 bedeutet vorübergehende Dienstüberlastung. Warte einige Sekunden und versuche es erneut.
Häufig gestellte Fragen
Was wird für den API-Aufruf benötigt?
Ein Schlüssel für ein registriertes Konto und eine HTTPS-Anfrage an https://api.apidamoxing.com/v1. Der Header muss das Bearer-Token enthalten. Der Rest entspricht dem Format der Chat-Completion.
Welche Funktionen werden unterstützt und welche nicht?
Unterstützt werden Textdialog, Streaming und Function Calling. Nicht unterstützt werden Bilder, Audio, Video, Vektor-Embeddings und Fine-Tuning.
Warum wird die Antwort abgeschnitten?
Normalerweise wurde das max_tokens-Limit erreicht. Der Standardwert beträgt 2048, er kann auf 32.000 erhöht werden. Die Summe aus Prompt und Ausgabe darf 100.000 Token nicht überschreiten.
Was passiert, wenn das Guthaben aufgebraucht ist?
Die Anfrage gibt 402 und no_credit zurück. Nach dem Aufladen des Prepaid-Guthaben kannst du fortfahren. Das Guthaben verfällt nie.
Wer kann diesen Dienst nicht nutzen?
Personen unter 18 Jahren. Sexuelle Inhalte, die Minderjährige involvieren, werden unabhängig davon, ob sie fiktiv sind, abgelehnt und mit 403 beantwortet.
Fülle einfach das Formular aus, um deinen Schlüssel zu erhalten
Erstelle ein Konto, kopiere den Schlüssel und ändere die Base URL. Die Konfiguration ist so einfach.