Dokumentation
Anleitung für Kunden, Hosts und Integratoren.
Überblick
LLM Market ist ein Marktplatz für LLM-API-Zugang. Du kannst:
- Als Kunde Tokens kaufen und über eine OpenAI-kompatible API auf verschiedene Modelle zugreifen.
- Als Host einen eigenen LLM-Server (lokal oder Cloud) registrieren und pro Million Tokens Geld verdienen.
- Als Admin Plattform-Statistiken und User-Verwaltung einsehen.
Die Plattform vermittelt zwischen Kunden und Hosts. Sie nimmt pro Transaktion eine Kommissionsgebühr. Hosts sehen den Erlös abzüglich Kommission, Kunden bezahlen den Listenpreis des Providers.
Base-URL der API: https://llm4a.com/v1 (OpenAI-kompatibel).
Authentifizierung
Alle Endpoints außer /, /browser und /register verlangen eine Authentifizierung. Es gibt zwei Wege:
- Session-Cookie — du loggst dich im Browser ein, der Cookie wird automatisch mitgesendet. Für das Web-UI.
- API-Key — Header
X-API-Key: sk-...oderAuthorization: Bearer sk-.... Für Scripts, Apps, externe Tools.
Wer ohne Authentifizierung versucht zu chatten, bekommt HTTP 401 Authentication required. Wer zwar authentifiziert ist, aber kein Guthaben hat, bekommt HTTP 402 Payment Required.
Schnellstart
- Account erstellen — geh auf /register, E-Mail und Passwort eingeben. Standard-Rolle ist Customer.
- Wallet aufladen — im Wallet-Dashboard einen Betrag einzahlen (via Stripe oder PayPal, je nach Konfiguration). Guthaben wird in USD abgerechnet.
- API-Key generieren — im API-Keys Dashboard auf "Neuer Key" klicken. Der Key wird genau einmal im Klartext angezeigt, danach nur noch als Hash.
- Modell wählen — im Marktplatz siehst du alle verfügbaren Modelle mit Preis, Latenz und Verfügbarkeit. Klicke auf ein Modell um die Provider-Liste zu sehen.
- Erste Anfrage senden — mit dem OpenAI-SDK oder einem beliebigen HTTP-Client:
curl -X POST https://llm4a.com/v1/chat/completions \
-H "X-API-Key: sk-llm-dein-key-hier" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
"messages": [{"role": "user", "content": "Hallo"}]
}'
API-Keys
API-Keys sind als SHA-256-Hash gespeichert. Die Plattform sieht deinen Key nie im Klartext, sobald er generiert wurde.
- Erstellen: /api-keys → "Neuer Key" → Name + optionales Budget (in USD) + optionales Rate-Limit (Requests/Minute).
- Verwendung: Header
X-API-Key: sk-...(bevorzugt) oderAuthorization: Bearer sk-.... - Budget: optional, z.B. 10 USD. Wenn
budget_usd > 0undspent_usd >= budget_usd, gibt der ServerHTTP 402 API key budget exceededzurück. - Rate-Limit: pro Key einstellbar. Standard 60 Requests/Minute. Bei Überschreitung:
HTTP 429 Rate limit exceeded. - Widerrufen: im Dashboard auf "Löschen" klicken. Der Hash verschwindet aus der DB, der Key ist sofort ungültig.
- Tracking: pro Key werden Tokens, Kosten, letzte Nutzung und Rate-Limit-Treffer geloggt.
Chat-API
OpenAI-kompatibel. Funktioniert mit dem offiziellen OpenAI-SDK (Python, JS, Go, etc.) und mit jedem HTTP-Client.
Python
from openai import OpenAI
client = OpenAI(
api_key="sk-llm-dein-key-hier",
base_url="https://llm4a.com/v1"
)
response = client.chat.completions.create(
model="qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
messages=[{"role": "user", "content": "Erkläre Quantencomputing"}]
)
print(response.choices[0].message.content)
JavaScript
import OpenAI from "openai";
const client = new OpenAI({
apiKey: "sk-llm-dein-key-hier",
baseURL: "https://llm4a.com/v1"
});
const response = await client.chat.completions.create({
model: "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
messages: [{ role: "user", content: "Erkläre Quantencomputing" }]
});
console.log(response.choices[0].message.content);
Streaming (SSE)
stream = client.chat.completions.create(
model="qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
messages=[{"role": "user", "content": "Schreibe ein Gedicht"}],
stream=True
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")
Abrechnung
Die Plattform zählt Tokens mit tiktoken (GPT-4-Encoding) und nutzt diese Zahl als Abrechnungsbasis. Was der Provider zurückmeldet, ist nur Audit-Info. So kann kein Provider zu niedrige Token-Counts zurückschicken und damit den Preis drücken.
Preis pro 1M Tokens variiert pro Provider. Beispiel: $0.50/Mio für einen Cloud-Provider, $1.00/Mio für einen Homelab-Server. Der Marktplatz zeigt den aktuellen Preis pro Modell.
System-Prompts
Wenn deine Anfrage kein role: "system"-Message enthält, injiziert die Plattform automatisch einen Denk-Prompt, der das Modell anweist, Überlegungen in <think>...</think>-Tags zu schreiben, bevor es antwortet. Wenn du einen eigenen System-Prompt setzt, wird deiner verwendet.
Marktplatz
Der Modell-Browser listet alle verfügbaren Modelle. Pro Modell siehst du:
- Anzahl Provider (z.B. "1/1 healthy" = ein Provider, aktuell online)
- Preisbereich (min bis max pro 1M Tokens)
- Bester Preis (günstigster Provider)
- Filter: nur gesunde Provider, unter X USD, Multi-Provider-Modelle
- Sortierung: Beste Verfügbarkeit, Name A–Z, Günstigster Preis, Meiste Anbieter
Klick auf ein Modell um die Provider-Liste zu sehen. Pro Provider:
- Name, Modell-Identifier, URL
- Preis pro 1M Tokens
- Uptime-Prozent (aus den letzten ~20 Health-Checks)
- Tokens/Sekunde (gemittelt aus echten Chat-Anfragen der letzten 24h)
- Latenz des letzten Health-Checks in Millisekunden
- Status (Online / Offline)
Provider-Hosting
Als Host kannst du einen eigenen LLM-Server anbieten. Du brauchst:
- Einen Account mit Rolle Host (oder Rolle Admin für plattformweite Provider).
- Einen LLM-Server, der OpenAI-kompatibel antwortet. Entweder lokal (llama.cpp, Ollama, vLLM, etc.) oder ein Cloud-API-Zugang (OpenAI, Anthropic via OpenAI-kompatibler Bridge, MiniMax, Groq, etc.).
- Optional: einen
/health-Endpoint, der bei laufendem Server200 OKzurückgibt.
Provider registrieren
Im Host-Dashboard auf "Provider hinzufügen" klicken. Pflichtfelder:
- Name — wird im Marktplatz angezeigt (z.B. "Mihi Homelab GPU")
- Modell — der Modell-Identifier, den der Server erwartet (z.B.
qwen3.6-35b-a3b-q4_k_moderMiniMax-M3) - Endpoint URL — Basis-URL ohne trailing slash (z.B.
http://192.168.1.50:8080oderhttps://api.openai.com/v1) - Preis pro 1M Tokens — in USD. Die Plattform berechnet daraus deinen Erlös abzüglich Kommission.
- API-Key — optional. Wird als
Authorization: Bearer ...an den Provider mitgesendet.
Verdienste
Jeder Token, der von deinem Provider verbraucht wird, bringt dir Geld. Die Plattform nimmt Kommissionsgebühr (Standard 15%, im Admin-Panel konfigurierbar pro Provider). Beispielrechnung:
Preis: $1.00 / 1M Tokens
Verbrauch: 2.5M Tokens (Input + Output)
Brutto: $2.50
Kommission: -$0.375 (15%)
Auszahlung: $2.125 an dich
Auszahlung: dein host_earnings_usd-Saldo wird im Host-Dashboard angezeigt. Über den "Auszahlen"-Button kannst du das Geld auf dein verbundenes Zahlungsmittel transferieren (Stripe Connect / PayPal, je nach Konfiguration).
Health-Checks
Die Plattform prüft regelmäßig, ob dein Provider erreichbar ist. Dafür wird eine HTTP-Anfrage mit 3-Sekunden-Timeout an eine von drei URLs geschickt, in dieser Reihenfolge:
GET {url}/health— bevorzugt für lokale Homelab-Server (schnell, dediziert)GET {url}/v1/models— OpenAI-kompatibel, für Cloud-APIs wie MiniMax, OpenAI, Groq, Together, die keinen/health-Endpoint habenGET {url}/api/tags— Ollama-natives Format, für lokale Ollama-Server ohne/health
Wenn irgendeine dieser URLs mit 2xx antwortet, ist der Provider "healthy". So werden auch Cloud-APIs korrekt als online erkannt, die kein dediziertes Health-Endpoint anbieten.
Health-Checks laufen alle ~30 Sekunden pro aktivem Provider, das Ergebnis wird im Health-Cache für 30 Sekunden gehalten um die Last zu reduzieren. Die letzten ~20 Checks pro Provider werden in der History-Tabelle gespeichert und für die Uptime-Berechnung verwendet.
LLM Market in Hermes und OpenClaw verwenden
Hermes und OpenClaw unterstützen beliebige OpenAI-kompatible Endpoints. Du kannst LLM Market also direkt als Provider für deinen Agent eintragen.
Hermes
Hermes liest seine LLM-Konfiguration aus ~/.hermes/config.yaml. Eintrag für LLM Market:
providers:
- name: llm-market
type: openai
base_url: https://llm4a.com/v1
api_key: sk-llm-dein-key-hier
default_model: qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive
Danach in ~/.hermes/AGENTS.md oder in den jeweiligen Agent-Configs die model-Eigenschaft auf llm-market/qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive setzen. Alternativ als Fallback in der Provider-Liste, falls der primär-Provider down ist.
Modell-Liste: alle Modelle die auf dem Marktplatz verfügbar sind. Im Zweifel Modell-Identifier aus dem Browser kopieren.
OpenClaw
OpenClaw-Konfiguration üblicherweise unter ~/.openclaw/config.toml oder im Web-UI unter "Providers":
[providers.llm_market]
type = "openai"
base_url = "https://llm4a.com/v1"
api_key = "sk-llm-dein-key-hier"
default_model = "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive"
[models]
primary = "llm_market/qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive"
fallback = "llm_market/MiniMax-M3"
Falls OpenClaw ein Web-UI hat: bei "Custom Provider" oder "OpenAI-kompatibel" den Base-URL und den Key eintragen, dann unter "Models" die gewünschten Modell-Identifier aus dem Marktplatz hinzufügen.
Modell-Auswahl
Welches Modell du wählst, hängt vom Use-Case ab:
- qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive — uncensored, groß, gut für kreative oder technische Aufgaben, lokales Homelab-Modell
- qwen3.6-35b-a3b-uncensored-genesis-hermes-v3 — eine Variante, oft etwas konservativer
- MiniMax-M3 — kompakteres Cloud-Modell, schnell und billig, gut für Klassifikations- oder Bulk-Aufgaben
Die genau verfügbaren Modelle findest du jederzeit im Modell-Browser. Neue Modelle erscheinen sobald ein Host einen Provider mit dem entsprechenden Identifier registriert.
Kostenkontrolle
Setz in deinem API-Key ein monatliches Budget (z.B. $20), dann kann Hermes/OpenClaw nicht versehentlich hunderte Dollar an Tokens verbrauchen. Die Plattform blockt weitere Requests sobald das Budget aufgebraucht ist und schickt HTTP 402.
FAQ
Was kostet ein Request?
Der Preis ist pro 1M Tokens und variiert pro Provider. Beispielrechnung: 500 Input- + 200 Output-Tokens bei $0.50/Mio = (500+200) / 1.000.000 * 0.50 = $0.00035 pro Anfrage. Die genauen Kosten siehst du in der Usage-Statistik pro API-Key.
Was passiert wenn mein Provider offline geht, während ein Request läuft?
Der laufende Request schlägt mit HTTP 502 Provider failed fehl. Dein Wallet wird nicht belastet (die Belastung passiert erst nach erfolgreicher Antwort). Du kannst sofort einen anderen Provider wählen und es nochmal versuchen.
Was passiert wenn ich keinen /health-Endpoint habe?
Kein Problem. Die Plattform versucht zuerst /health, dann /v1/models (OpenAI-kompatibel), dann /api/tags (Ollama-nativ). Egal welche URL mit 2xx antwortet, der Provider gilt als online. Lokale Ollama-Server ohne dediziertes Health-Endpoint funktionieren genauso wie Cloud-APIs wie MiniMax oder OpenAI.
Kann ich mehrere Modelle parallel nutzen?
Ja. Erstelle für jedes Projekt einen eigenen API-Key mit eigenem Budget und Rate-Limit. Im Marktplatz siehst du alle verfügbaren Modelle, jedes Modell hat eine eigene Provider-Liste.
Wer hat Zugriff auf meine Chat-Daten?
Deine Anfragen gehen direkt an den Provider den du gewählt hast. Die Plattform loggt nur Metadaten (Tokens, Kosten, Zeitstempel, API-Key-ID) in der Usage-Tabelle. Die Inhalte der Messages werden nicht persistent gespeichert. Allerdings leiten wir Anfragen an externe Cloud-Provider weiter — wenn du das nicht willst, nutze nur lokale Homelab-Provider.