Dokumentation

Anleitung für Kunden, Hosts und Integratoren.

Überblick

llm4a ist ein Marktplatz für LLM-API-Zugang. Du kannst:

Die Plattform vermittelt zwischen Kunden und Hosts. Sie nimmt pro Transaktion eine Kommissionsgebühr. Hosts sehen den Erlös abzüglich Kommission, Kunden bezahlen den Listenpreis des Providers.

Base-URL der API: https://llm4a.com/v1 (OpenAI-kompatibel).

Authentifizierung

Alle Endpoints außer /, /browser und /register verlangen eine Authentifizierung. Es gibt zwei Wege:

  1. Session-Cookie — du loggst dich im Browser ein, der Cookie wird automatisch mitgesendet. Für das Web-UI.
  2. API-Key — Header X-API-Key: *** oder Authorization: Bearer *** Für Scripts, Apps, externe Tools.

Wer ohne Authentifizierung versucht zu chatten, bekommt HTTP 401 Authentication required. Wer zwar authentifiziert ist, aber kein Guthaben hat, bekommt HTTP 402 Payment Required.

Schnellstart

  • Account erstellen — geh auf /register, E-Mail und Passwort eingeben. Standard-Rolle ist Customer.
  • Wallet aufladen — im Wallet-Dashboard einen Betrag einzahlen (via Stripe oder PayPal, je nach Konfiguration). Guthaben wird in USD abgerechnet.
  • API-Key generieren — im API-Keys Dashboard auf
  • Modell wählen — im Marktplatz siehst du alle verfügbaren Modelle mit Preis, Latenz und Verfügbarkeit. Klicke auf ein Modell um die Provider-Liste zu sehen.
  • Erste Anfrage senden — mit dem OpenAI-SDK oder einem beliebigen HTTP-Client:
curl -X POST https://llm4a.com/v1/chat/completions \
  -H "X-API-Key: *** \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
    "messages": [{"role": "user", "content": "Hallo"}]
  }'

API-Keys

API-Keys sind als SHA-256-Hash gespeichert. Die Plattform sieht deinen Key nie im Klartext, sobald er generiert wurde.

  • Erstellen: /api-keys → "Neuer Key" → Name + optionales Budget (in USD) + optionales Rate-Limit (Requests/Minute).
  • Verwendung: Header X-API-Key: *** (bevorzugt) oder Authorization: Bearer sk-....../li>
  • Budget: optional, z.B. 10 USD. Wenn budget_usd > 0 und spent_usd >= budget_usd, gibt der Server HTTP 402 API key budget exceeded zurückgibt.
  • Rate-Limit: pro Key einstellbar. Standard 60 Requests/Minute. Bei Überschreitung: HTTP 429 Rate limit exceeded.
  • Widerrufen: im Dashboard auf
  • Tracking: pro Key werden Tokens, Kosten, letzte Nutzung und Rate-Limit-Treffer geloggt.

Chat-API

OpenAI-kompatibel. Funktioniert mit dem offiziellen OpenAI-SDK (Python, JS, Go, etc.) und mit jedem HTTP-Client.

Python

from openai import OpenAI

client = OpenAI(
    api_key="«redacted:sk-…»",
    base_url="https://llm4a.com/v1"
)

response = client.chat.completions.create(
    model="qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
    messages=[{"role": "user", "content": "Erkläre Quantencomputing"}]
)

print(response.choices[0].message.content)

JavaScript

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "«reda...…»",
  baseURL: "https://llm4a.com/v1"
});

const response = await client.chat.completions.create({
  model: "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
  messages: [{ role: "user", content: "Erkläre Quantencomputing" }],
});

console.log(response.choices[0].message.content);

Streaming (SSE)

stream = client.chat.completions.create(
    model="qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
    messages=[{"role": "user", "content": "Schreibe ein Gedicht"}],
    stream=True
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

Abrechnung

Die Plattform zählt Tokens mit tiktoken (GPT-4-Encoding) und nutzt diese Zahl als Abrechnungsbasis. Was der Provider zurückmeldet, ist nur Audit-Info. So kann kein Provider zu niedrige Token-Counts zurückschicken und damit den Preis drücken.

Preis pro 1M Tokens variiert pro Provider. Beispiel: $0.50/Mio für einen Cloud-Provider, $1.00/Mio für einen Homelab-Server. Der Marktplatz zeigt den aktuellen Preis pro Modell.

System-Prompts

Wenn deine Anfrage kein role: "system"-Message enthält, injiziert die Plattform automatisch einen Denk-Prompt, der das Modell anweist, Überlegungen in <think>...</think>-Tags zu schreiben, bevor es antwortet. Wenn du einen eigenen System-Prompt setzt, wird deiner verwendet.

Marktplatz

Der Modell-Browser listet alle verfügbaren Modelle. Pro Modell siehst du:

  • Anzahl Provider (z.B.
  • Preisbereich (min bis max pro 1M Tokens)
  • Bester Preis (günstigster Provider)
  • Filter: nur gesunde Provider, unter X USD, Multi-Provider-Modelle
  • Sortierung: Beste Verfügbarkeit, Name A–Z, Günstigster Preis, Meiste Anbieter

Klick auf ein Modell um die Provider-Liste zu sehen. Pro Provider:

  • Name, Modell-Identifier, URL
  • Preis pro 1M Tokens
  • Uptime-Prozent (aus den letzten ~20 Health-Checks)
  • Tokens/Sekunde (gemittelt aus echten Chat-Anfragen der letzten 24h)
  • Latenz des letzten Health-Checks in Millisekunden
  • Status (Online / Offline)

Provider-Hosting

Als Host kannst du einen eigenen LLM-Server anbieten. Du brauchst:

  • Einen Account mit Rolle Host (oder Rolle Admin für plattformweite Provider).
  • Einen LLM-Server, der OpenAI-kompatibel antwortet. Entweder lokal (llama.cpp, Ollama, vLLM, etc.) oder ein Cloud-API-Zugang (OpenAI, Anthropic via OpenAI-kompatibler Bridge, MiniMax, Groq, etc.).
  • Optional: einen /health-Endpoint, der bei laufendem Server 200 OK zurückgibt.

Provider registrieren

Im Host-Dashboard auf

  • Name — wird im Marktplatz angezeigt (z.B.
  • Modell — der Modell-Identifier, den der Server erwartet (z.B. qwen3.6-35b-a3b-q4_k_m oder MiniMax-M3)
  • Endpoint URL — Basis-URL ohne trailing slash (z.B. http://192.168.1.50:8080 oder https://api.openai.com/v1)
  • Preis pro 1M Tokens — in USD. Die Plattform berechnet daraus deinen Erlös abzüglich Kommission.
  • API-Key — optional. Wird als Authorization: Bearer *** an den Provider mitgesendet.

Verdienste

Jeder Token, der von deinem Provider verbraucht wird, bringt dir Geld. Die Plattform nimmt Kommissionsgebühr (Standard 15%, im Admin-Panel konfigurierbar pro Provider). Beispielrechnung:

Preis:        $1.00 / 1M Tokens
|Verbrauch:    2.5M Tokens (Input + Output)
|Brutto:       $2.50
|Kommission:   -$0.375 (15%)
|Auszahlung:   $2.125 an dich

Auszahlung: dein host_earnings_usd-Saldo wird im Host-Dashboard angezeigt. Über den

Health-Checks

Die Plattform prüft regelmäßig, ob dein Provider erreichbar ist. Dafür wird eine HTTP-Anfrage mit 3-Sekunden-Timeout an eine von drei URLs geschickt, in dieser Reihenfolge:

  1. GET {url}/health — bevorzugt für lokale Homelab-Server (schnell, dediziert)
  2. GET {url}/v1/models — OpenAI-kompatibel, für Cloud-APIs wie MiniMax, OpenAI, Groq, Together, die keinen /health-Endpoint haben
  3. GET {url}/api/tags — Ollama-natives Format, für lokale Ollama-Server ohne /health

Wenn irgendeine dieser URLs mit 2xx antwortet, ist der Provider

Health-Checks laufen alle ~30 Sekunden pro aktivem Provider, das Ergebnis wird im Health-Cache für 30 Sekunden gehalten um die Last zu reduzieren. Die letzten ~20 Checks pro Provider werden in der History-Tabelle gespeichert und für die Uptime-Berechnung verwendet.

llm4a in Hermes und OpenClaw verwenden

Hermes und OpenClaw unterstützen beliebige OpenAI-kompatible Endpoints. Du kannst llm4a also direkt als Provider für deinen Agent eintragen.

Hermes

Hermes liest seine LLM-Konfiguration aus ~/.hermes/config.yaml. Eintrag für llm4a:

providers:
  - name: llm-market
    type: openai
    base_url: https://llm4a.com/v1
    api_key: «redacted:sk-…»
    default_model: qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive

Danach in ~/.hermes/AGENTS.md oder in den jeweiligen Agent-Configs die model-Eigenschaft auf llm-market/qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive setzen. Alternativ als Fallback in der Provider-Liste, falls der primär-Provider down ist.

Modell-Liste: alle Modelle die auf dem Marktplatz verfügbar sind. Im Zweifel Modell-Identifier aus dem Browser kopieren.

OpenClaw

OpenClaw-Konfiguration üblicherweise unter ~/.openclaw/config.toml oder im Web-UI unter

[providers.llm_market]
type = "openai"
base_url = "https://llm4a.com/v1"
api_key = "«redacted:sk-…»"
default_model = "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive"

[models]
primary = "llm_market/qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive"
fallback = "llm_market/MiniMax-M3"

Falls OpenClaw ein Web-UI hat: bei

Modell-Auswahl

Welches Modell du wählst, hängt vom Use-Case ab:

  • qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive — uncensored, groß, gut für kreative oder technische Aufgaben, lokales Homelab-Modell
  • qwen3.6-35b-a3b-uncensored-genesis-hermes-v3 — eine Variante, oft etwas konservativer
  • MiniMax-M3 — kompakteres Cloud-Modell, schnell und billig, gut für Klassifikations- oder Bulk-Aufgaben

Die genau verfügbaren Modelle findest du jederzeit im Modell-Browser. Neue Modelle erscheinen sobald ein Host einen Provider mit dem entsprechenden Identifier registriert.

Kostenkontrolle

Setz in deinem API-Key ein monatliches Budget (z.B. $20), dann kann Hermes/OpenClaw nicht versehentlich hunderte Dollar an Tokens verbrauchen. Die Plattform blockt weitere Requests sobald das Budget aufgebraucht ist und schickt HTTP 402.

FAQ

Was kostet ein Request?

Der Preis ist pro 1M Tokens und variiert pro Provider. Beispielrechnung: 500 Input- + 200 Output-Tokens bei $0.50/Mio = (500+200) / 1.000.000 * 0.50 = $0.00035 pro Anfrage. Die genauen Kosten siehst du in der Usage-Statistik pro API-Key.

Was passiert wenn mein Provider offline geht, während ein Request läuft?

Der laufende Request schlägt mit HTTP 502 Provider failed fehl. Dein Wallet wird nicht belastet (die Belastung passiert erst nach erfolgreicher Antwort). Du kannst sofort einen anderen Provider wählen und es nochmal versuchen.

Was passiert wenn ich keinen /health-Endpoint habe?

Kein Problem. Die Plattform versucht zuerst /health, dann /v1/models (OpenAI-kompatibel), dann /api/tags (Ollama-nativ). Egal welche URL mit 2xx antwortet, der Provider gilt als online. Lokale Ollama-Server ohne dediziertes Health-Endpoint funktionieren genauso wie Cloud-APIs wie MiniMax oder OpenAI.

Kann ich mehrere Modelle parallel nutzen?

Ja. Erstelle für jedes Projekt einen eigenen API-Key mit eigenem Budget und Rate-Limit. Im Marktplatz siehst du alle verfügbaren Modelle, jedes Modell hat eine eigene Provider-Liste.

Wer hat Zugriff auf meine Chat-Daten?

Deine Anfragen gehen direkt an den Provider den du gewählt hast. Die Plattform loggt nur Metadaten (Tokens, Kosten, Zeitstempel, API-Key-ID) in der Usage-Tabelle. Die Inhalte der Messages werden nicht persistent gespeichert. Allerdings leiten wir Anfragen an externe Cloud-Provider weiter — wenn du das nicht willst, nutze nur lokale Homelab-Provider.