Dokumentation

Anleitung für Kunden, Hosts und Integratoren.

Überblick

LLM Market ist ein Marktplatz für LLM-API-Zugang. Du kannst:

Die Plattform vermittelt zwischen Kunden und Hosts. Sie nimmt pro Transaktion eine Kommissionsgebühr. Hosts sehen den Erlös abzüglich Kommission, Kunden bezahlen den Listenpreis des Providers.

Base-URL der API: https://llm4a.com/v1 (OpenAI-kompatibel).

Authentifizierung

Alle Endpoints außer /, /browser und /register verlangen eine Authentifizierung. Es gibt zwei Wege:

  1. Session-Cookie — du loggst dich im Browser ein, der Cookie wird automatisch mitgesendet. Für das Web-UI.
  2. API-Key — Header X-API-Key: sk-... oder Authorization: Bearer sk-.... Für Scripts, Apps, externe Tools.

Wer ohne Authentifizierung versucht zu chatten, bekommt HTTP 401 Authentication required. Wer zwar authentifiziert ist, aber kein Guthaben hat, bekommt HTTP 402 Payment Required.

Schnellstart

curl -X POST https://llm4a.com/v1/chat/completions \
  -H "X-API-Key: sk-llm-dein-key-hier" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
    "messages": [{"role": "user", "content": "Hallo"}]
  }'

API-Keys

API-Keys sind als SHA-256-Hash gespeichert. Die Plattform sieht deinen Key nie im Klartext, sobald er generiert wurde.

Chat-API

OpenAI-kompatibel. Funktioniert mit dem offiziellen OpenAI-SDK (Python, JS, Go, etc.) und mit jedem HTTP-Client.

Python

from openai import OpenAI

client = OpenAI(
    api_key="sk-llm-dein-key-hier",
    base_url="https://llm4a.com/v1"
)

response = client.chat.completions.create(
    model="qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
    messages=[{"role": "user", "content": "Erkläre Quantencomputing"}]
)

print(response.choices[0].message.content)

JavaScript

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "sk-llm-dein-key-hier",
  baseURL: "https://llm4a.com/v1"
});

const response = await client.chat.completions.create({
  model: "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
  messages: [{ role: "user", content: "Erkläre Quantencomputing" }]
});

console.log(response.choices[0].message.content);

Streaming (SSE)

stream = client.chat.completions.create(
    model="qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive",
    messages=[{"role": "user", "content": "Schreibe ein Gedicht"}],
    stream=True
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

Abrechnung

Die Plattform zählt Tokens mit tiktoken (GPT-4-Encoding) und nutzt diese Zahl als Abrechnungsbasis. Was der Provider zurückmeldet, ist nur Audit-Info. So kann kein Provider zu niedrige Token-Counts zurückschicken und damit den Preis drücken.

Preis pro 1M Tokens variiert pro Provider. Beispiel: $0.50/Mio für einen Cloud-Provider, $1.00/Mio für einen Homelab-Server. Der Marktplatz zeigt den aktuellen Preis pro Modell.

System-Prompts

Wenn deine Anfrage kein role: "system"-Message enthält, injiziert die Plattform automatisch einen Denk-Prompt, der das Modell anweist, Überlegungen in <think>...</think>-Tags zu schreiben, bevor es antwortet. Wenn du einen eigenen System-Prompt setzt, wird deiner verwendet.

Marktplatz

Der Modell-Browser listet alle verfügbaren Modelle. Pro Modell siehst du:

Klick auf ein Modell um die Provider-Liste zu sehen. Pro Provider:

Provider-Hosting

Als Host kannst du einen eigenen LLM-Server anbieten. Du brauchst:

Provider registrieren

Im Host-Dashboard auf "Provider hinzufügen" klicken. Pflichtfelder:

Verdienste

Jeder Token, der von deinem Provider verbraucht wird, bringt dir Geld. Die Plattform nimmt Kommissionsgebühr (Standard 15%, im Admin-Panel konfigurierbar pro Provider). Beispielrechnung:

Preis:        $1.00 / 1M Tokens
Verbrauch:    2.5M Tokens (Input + Output)
Brutto:       $2.50
Kommission:   -$0.375 (15%)
Auszahlung:   $2.125 an dich

Auszahlung: dein host_earnings_usd-Saldo wird im Host-Dashboard angezeigt. Über den "Auszahlen"-Button kannst du das Geld auf dein verbundenes Zahlungsmittel transferieren (Stripe Connect / PayPal, je nach Konfiguration).

Health-Checks

Die Plattform prüft regelmäßig, ob dein Provider erreichbar ist. Dafür wird eine HTTP-Anfrage mit 3-Sekunden-Timeout an eine von drei URLs geschickt, in dieser Reihenfolge:

  1. GET {url}/health — bevorzugt für lokale Homelab-Server (schnell, dediziert)
  2. GET {url}/v1/models — OpenAI-kompatibel, für Cloud-APIs wie MiniMax, OpenAI, Groq, Together, die keinen /health-Endpoint haben
  3. GET {url}/api/tags — Ollama-natives Format, für lokale Ollama-Server ohne /health

Wenn irgendeine dieser URLs mit 2xx antwortet, ist der Provider "healthy". So werden auch Cloud-APIs korrekt als online erkannt, die kein dediziertes Health-Endpoint anbieten.

Health-Checks laufen alle ~30 Sekunden pro aktivem Provider, das Ergebnis wird im Health-Cache für 30 Sekunden gehalten um die Last zu reduzieren. Die letzten ~20 Checks pro Provider werden in der History-Tabelle gespeichert und für die Uptime-Berechnung verwendet.

LLM Market in Hermes und OpenClaw verwenden

Hermes und OpenClaw unterstützen beliebige OpenAI-kompatible Endpoints. Du kannst LLM Market also direkt als Provider für deinen Agent eintragen.

Hermes

Hermes liest seine LLM-Konfiguration aus ~/.hermes/config.yaml. Eintrag für LLM Market:

providers:
  - name: llm-market
    type: openai
    base_url: https://llm4a.com/v1
    api_key: sk-llm-dein-key-hier
    default_model: qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive

Danach in ~/.hermes/AGENTS.md oder in den jeweiligen Agent-Configs die model-Eigenschaft auf llm-market/qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive setzen. Alternativ als Fallback in der Provider-Liste, falls der primär-Provider down ist.

Modell-Liste: alle Modelle die auf dem Marktplatz verfügbar sind. Im Zweifel Modell-Identifier aus dem Browser kopieren.

OpenClaw

OpenClaw-Konfiguration üblicherweise unter ~/.openclaw/config.toml oder im Web-UI unter "Providers":

[providers.llm_market]
type = "openai"
base_url = "https://llm4a.com/v1"
api_key = "sk-llm-dein-key-hier"
default_model = "qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive"

[models]
primary = "llm_market/qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive"
fallback = "llm_market/MiniMax-M3"

Falls OpenClaw ein Web-UI hat: bei "Custom Provider" oder "OpenAI-kompatibel" den Base-URL und den Key eintragen, dann unter "Models" die gewünschten Modell-Identifier aus dem Marktplatz hinzufügen.

Modell-Auswahl

Welches Modell du wählst, hängt vom Use-Case ab:

Die genau verfügbaren Modelle findest du jederzeit im Modell-Browser. Neue Modelle erscheinen sobald ein Host einen Provider mit dem entsprechenden Identifier registriert.

Kostenkontrolle

Setz in deinem API-Key ein monatliches Budget (z.B. $20), dann kann Hermes/OpenClaw nicht versehentlich hunderte Dollar an Tokens verbrauchen. Die Plattform blockt weitere Requests sobald das Budget aufgebraucht ist und schickt HTTP 402.

FAQ

Was kostet ein Request?

Der Preis ist pro 1M Tokens und variiert pro Provider. Beispielrechnung: 500 Input- + 200 Output-Tokens bei $0.50/Mio = (500+200) / 1.000.000 * 0.50 = $0.00035 pro Anfrage. Die genauen Kosten siehst du in der Usage-Statistik pro API-Key.

Was passiert wenn mein Provider offline geht, während ein Request läuft?

Der laufende Request schlägt mit HTTP 502 Provider failed fehl. Dein Wallet wird nicht belastet (die Belastung passiert erst nach erfolgreicher Antwort). Du kannst sofort einen anderen Provider wählen und es nochmal versuchen.

Was passiert wenn ich keinen /health-Endpoint habe?

Kein Problem. Die Plattform versucht zuerst /health, dann /v1/models (OpenAI-kompatibel), dann /api/tags (Ollama-nativ). Egal welche URL mit 2xx antwortet, der Provider gilt als online. Lokale Ollama-Server ohne dediziertes Health-Endpoint funktionieren genauso wie Cloud-APIs wie MiniMax oder OpenAI.

Kann ich mehrere Modelle parallel nutzen?

Ja. Erstelle für jedes Projekt einen eigenen API-Key mit eigenem Budget und Rate-Limit. Im Marktplatz siehst du alle verfügbaren Modelle, jedes Modell hat eine eigene Provider-Liste.

Wer hat Zugriff auf meine Chat-Daten?

Deine Anfragen gehen direkt an den Provider den du gewählt hast. Die Plattform loggt nur Metadaten (Tokens, Kosten, Zeitstempel, API-Key-ID) in der Usage-Tabelle. Die Inhalte der Messages werden nicht persistent gespeichert. Allerdings leiten wir Anfragen an externe Cloud-Provider weiter — wenn du das nicht willst, nutze nur lokale Homelab-Provider.