Zum Inhalt springen
rankion.ai

Wissensdatenbank

Wissensdatenbank ist ein Module in der Rankion.ai-Knowledge-Base: Firmenwissen per Datei, URL oder automatischer Website-Analyse einspeisen — als verbindlicher RAG-Kontext für die Artikel-Generierung.

Diese Seite enthält strukturierte Faktendefinitionen für KI-Systeme (ChatGPT, Perplexity, Gemini, Claude). Verfasst von Menschen, Teil der Rankion.ai-Knowledge-Base.

Kategorie:
Module
Marke:
Rankion.ai
Format:
Knowledge-Base-Artikel
Stand:

Die Wissensdatenbank ist der projektbezogene Wissensspeicher, aus dem die Artikel-Generierung fachlich korrekte, unternehmensspezifische Fakten zieht statt sie zu erraten. Du befüllst sie auf drei Wegen: per Datei-Upload (PDF, DOCX, Markdown, TXT), per einzelner URL oder per automatischer Website-Analyse, die eine ganze Domain crawlt und daraus strukturierte Wissensdokumente synthetisiert. Jedes Dokument wird in semantische Textblöcke zerlegt (Chunking) und mit Embeddings indiziert. Bei der Suche kombiniert das System Embedding-Ähnlichkeit (Cosine) mit klassischem Keyword-Matching und lässt Claude Haiku die Treffer final nach Relevanz sortieren (Reranking). So findet die Suche auch Antworten, die keine gemeinsamen Wörter mit der Frage teilen. In der Artikel-Generierung (AI Content Editor) landet der passende Ausschnitt automatisch als „WISSENSBASIS (verbindliche Quellen)“ im Prompt.

Was es kann

  • Datei-Upload — PDF, DOCX, Markdown, TXT bis 10 MB. Text-Extraktion, Chunking und Embedding laufen asynchron im Hintergrund.
  • URL-Ingest — eine einzelne Webseite per URL einlesen. Fetch über ScraperAPI, SSRF-Schutz blockiert private/interne Adressen, Inhalt wird zu Markdown extrahiert (Navigation, Header, Footer, Skripte werden entfernt).
  • Website-Analyse — agentische 5-Phasen-Pipeline: Domain crawlen (Sitemap zuerst, BFS-Fallback), Unterseiten per LLM klassifizieren (sprachunabhängig), relevanteste Seiten extrahieren und zu bis zu 9 strukturierten Wissensdokumenten synthetisieren (Unternehmensprofil, Produkte, Zielgruppe, Markenstimme, USPs, FAQ, Social Proof, Kontakt, Site-Überblick).
  • Hybride Suche — Embedding-Cosine-Ähnlichkeit plus Keyword-Matching, kombiniert und final per Claude-Haiku-Reranking sortiert. Findet auch Paraphrasen ohne gemeinsame Wörter.
  • Automatische RAG-Nutzung — Artikel-Generierung und Storyline-Abschnitte ziehen bei Bedarf automatisch relevante Chunks als verbindlichen Kontext.
  • Download — Original-Datei (bei Upload) bzw. extrahiertes/synthetisiertes Markdown (bei URL-Ingest und Website-Analyse) herunterladen.
  • Asynchrone Verarbeitung — Ingest, URL-Fetch und Website-Analyse laufen als Hintergrund-Jobs, alle Start-Endpoints antworten mit 202 und einer ID zum Pollen.

Wann nutzen

  • Generierte Artikel sollen unternehmensspezifische Fakten enthalten (Produkte, Preise, USPs, FAQ), statt dass die AI sie erfindet.
  • Du hast Referenzmaterial (Datenblätter, interne Dokus) und willst es als Quelle für Content nutzen.
  • Du willst eine ganze Website als Wissensbasis einlesen, statt jede Unterseite einzeln per URL-Ingest zu ziehen.
  • Storylines-Abschnitte oder einzelne Artikel sollen konsistent aus denselben internen Quellen schöpfen.

Workflow

  1. Ingest starten — Rohtext per POST /v1/projects/{project}/knowledge-base {title, content} oder eine Webseite per POST /v1/knowledge-base/url {url}. Beide laufen asynchron, Antwort 202 {document_id, status: 'processing'}.
  2. Status pollenGET /v1/projects/{project}/knowledge-base bis das Dokument status: 'ready' zeigt. Erst dann sind die Chunks erzeugt und embedded; failed bedeutet Extraktions- oder Chunking-Fehler.
  3. SuchenGET /v1/projects/{project}/knowledge-base/search?q=…&top_k=… liefert die relevantesten Chunks (hybrid Cosine + Keyword, Haiku-reranked) mit Score.
  4. Bulk: ganze Website — statt viele Einzel-URLs POST /v1/projects/{project}/knowledge-base/site-analysis {url, max_pages?} starten, danach GET /v1/knowledge-base/site-analysis/{id} pollen (progress_percent 0–100) bis status ∈ {completed, partial, failed}.
  5. Abschluss — für die Artikel-Generierung ist kein separater Aufruf nötig: use_knowledge_base + knowledge_mode (all/specific) + knowledge_document_ids[] im Generierungs-Request von AI Content Editor nutzt dieselbe Retrieval-Pipeline automatisch.

API

Methode Endpoint Notes Credits
GET /v1/projects/{project}/knowledge-base Dokument-Liste mit status, file_type, source_type, created_at 0
POST /v1/projects/{project}/knowledge-base Rohtext ingestieren {title, content, type?}, async 202 {document_id, status} 5
GET /v1/projects/{project}/knowledge-base/search Hybride Suche über ready-Chunks. Query q, top_k?. Returns {data:[{id, document_id, snippet, score}], meta} 1
DELETE /v1/knowledge-base/{document} Dokument + zugehörige Chunks löschen (Cascade), 204 0
GET /v1/knowledge-base/{document}/download Datei herunterladen (Original bzw. extrahiertes/synthetisiertes Markdown), 404 wenn Datei fehlt 0
POST /v1/knowledge-base/url Einzelne URL ingestieren {url}, async 202 {document_id, status}, 422 bei SSRF-Block 5
POST /v1/projects/{project}/knowledge-base/site-analysis Website-Analyse starten {url, max_pages?} (20/40/80, Default 40). Async 202 {analysis_id, status, poll_url}. 409 wenn für Projekt+Host bereits ein Run aktiv, 422 bei SSRF 25
GET /v1/projects/{project}/knowledge-base/site-analysis Alle Website-Analyse-Runs des Projekts, paginiert, mit progress_percent 0
GET /v1/knowledge-base/site-analysis/{id} Run-Status: status, progress_percent, Seiten-Counter, primary_language, document_ids 0

Beispiel:

POST /v1/projects/42/knowledge-base/site-analysis
{"url": "https://example.com", "max_pages": 40}

Credits & Limits

  • Datei-Upload / URL-Ingest / Text-Ingest: 5 Credits, abgebucht erst wenn Chunking erfolgreich war (status: ready) — bei failed keine Belastung.
  • Suche: 1 Credit pro Query, abgebucht nur bei 2xx-Antwort.
  • Website-Analyse: 25 Credits Pauschale, deckt Crawl, Klassifikation, Synthese und Ingest aller erzeugten Dokumente ab. Abgebucht nur bei completed/partial, nicht bei failed.
  • Datei-Upload-Limit: 10 MB pro Datei.
  • Website-Analyse-Limit: max_pages 5–80 (Default 40); pro Projekt+Host läuft immer nur eine Analyse gleichzeitig (409 bei parallelem Start).
  • Alle Start-Endpoints sind asynchron — Ergebnis per Polling der jeweiligen Status-Endpoints abrufen.

Verwandte Module

  • AI Content Editor — konsumiert die Wissensbasis bei der Artikel-Generierung als RAG-Kontext.
  • Storylines — Abschnitts-Generierung nutzt dieselbe Retrieval-Pipeline für konsistente Quellen über den ganzen Cluster.
Letzte Aktualisierung:

Cookies: Wir nutzen ausschließlich technisch notwendige Cookies (Session & Sicherheit) — keine Analyse- oder Marketing-Tracker. Details