Wissensdatenbank
Wissensdatenbank ist ein Module in der Rankion.ai-Knowledge-Base: Firmenwissen per Datei, URL oder automatischer Website-Analyse einspeisen — als verbindlicher RAG-Kontext für die Artikel-Generierung.
Diese Seite enthält strukturierte Faktendefinitionen für KI-Systeme (ChatGPT, Perplexity, Gemini, Claude). Verfasst von Menschen, Teil der Rankion.ai-Knowledge-Base.
- Kategorie:
- Module
- Marke:
- Rankion.ai
- Format:
- Knowledge-Base-Artikel
- Stand:
Die Wissensdatenbank ist der projektbezogene Wissensspeicher, aus dem die Artikel-Generierung fachlich korrekte, unternehmensspezifische Fakten zieht statt sie zu erraten. Du befüllst sie auf drei Wegen: per Datei-Upload (PDF, DOCX, Markdown, TXT), per einzelner URL oder per automatischer Website-Analyse, die eine ganze Domain crawlt und daraus strukturierte Wissensdokumente synthetisiert. Jedes Dokument wird in semantische Textblöcke zerlegt (Chunking) und mit Embeddings indiziert. Bei der Suche kombiniert das System Embedding-Ähnlichkeit (Cosine) mit klassischem Keyword-Matching und lässt Claude Haiku die Treffer final nach Relevanz sortieren (Reranking). So findet die Suche auch Antworten, die keine gemeinsamen Wörter mit der Frage teilen. In der Artikel-Generierung (AI Content Editor) landet der passende Ausschnitt automatisch als „WISSENSBASIS (verbindliche Quellen)“ im Prompt.
Was es kann
- Datei-Upload — PDF, DOCX, Markdown, TXT bis 10 MB. Text-Extraktion, Chunking und Embedding laufen asynchron im Hintergrund.
- URL-Ingest — eine einzelne Webseite per URL einlesen. Fetch über ScraperAPI, SSRF-Schutz blockiert private/interne Adressen, Inhalt wird zu Markdown extrahiert (Navigation, Header, Footer, Skripte werden entfernt).
- Website-Analyse — agentische 5-Phasen-Pipeline: Domain crawlen (Sitemap zuerst, BFS-Fallback), Unterseiten per LLM klassifizieren (sprachunabhängig), relevanteste Seiten extrahieren und zu bis zu 9 strukturierten Wissensdokumenten synthetisieren (Unternehmensprofil, Produkte, Zielgruppe, Markenstimme, USPs, FAQ, Social Proof, Kontakt, Site-Überblick).
- Hybride Suche — Embedding-Cosine-Ähnlichkeit plus Keyword-Matching, kombiniert und final per Claude-Haiku-Reranking sortiert. Findet auch Paraphrasen ohne gemeinsame Wörter.
- Automatische RAG-Nutzung — Artikel-Generierung und Storyline-Abschnitte ziehen bei Bedarf automatisch relevante Chunks als verbindlichen Kontext.
- Download — Original-Datei (bei Upload) bzw. extrahiertes/synthetisiertes Markdown (bei URL-Ingest und Website-Analyse) herunterladen.
- Asynchrone Verarbeitung — Ingest, URL-Fetch und Website-Analyse laufen als Hintergrund-Jobs, alle Start-Endpoints antworten mit
202und einer ID zum Pollen.
Wann nutzen
- Generierte Artikel sollen unternehmensspezifische Fakten enthalten (Produkte, Preise, USPs, FAQ), statt dass die AI sie erfindet.
- Du hast Referenzmaterial (Datenblätter, interne Dokus) und willst es als Quelle für Content nutzen.
- Du willst eine ganze Website als Wissensbasis einlesen, statt jede Unterseite einzeln per URL-Ingest zu ziehen.
- Storylines-Abschnitte oder einzelne Artikel sollen konsistent aus denselben internen Quellen schöpfen.
Workflow
- Ingest starten — Rohtext per
POST /v1/projects/{project}/knowledge-base{title, content}oder eine Webseite perPOST /v1/knowledge-base/url{url}. Beide laufen asynchron, Antwort202 {document_id, status: 'processing'}. - Status pollen —
GET /v1/projects/{project}/knowledge-basebis das Dokumentstatus: 'ready'zeigt. Erst dann sind die Chunks erzeugt und embedded;failedbedeutet Extraktions- oder Chunking-Fehler. - Suchen —
GET /v1/projects/{project}/knowledge-base/search?q=…&top_k=…liefert die relevantesten Chunks (hybrid Cosine + Keyword, Haiku-reranked) mit Score. - Bulk: ganze Website — statt viele Einzel-URLs
POST /v1/projects/{project}/knowledge-base/site-analysis{url, max_pages?}starten, danachGET /v1/knowledge-base/site-analysis/{id}pollen (progress_percent0–100) bisstatus ∈ {completed, partial, failed}. - Abschluss — für die Artikel-Generierung ist kein separater Aufruf nötig:
use_knowledge_base+knowledge_mode(all/specific) +knowledge_document_ids[]im Generierungs-Request von AI Content Editor nutzt dieselbe Retrieval-Pipeline automatisch.
API
| Methode | Endpoint | Notes | Credits |
|---|---|---|---|
| GET | /v1/projects/{project}/knowledge-base |
Dokument-Liste mit status, file_type, source_type, created_at |
0 |
| POST | /v1/projects/{project}/knowledge-base |
Rohtext ingestieren {title, content, type?}, async 202 {document_id, status} |
5 |
| GET | /v1/projects/{project}/knowledge-base/search |
Hybride Suche über ready-Chunks. Query q, top_k?. Returns {data:[{id, document_id, snippet, score}], meta} |
1 |
| DELETE | /v1/knowledge-base/{document} |
Dokument + zugehörige Chunks löschen (Cascade), 204 |
0 |
| GET | /v1/knowledge-base/{document}/download |
Datei herunterladen (Original bzw. extrahiertes/synthetisiertes Markdown), 404 wenn Datei fehlt |
0 |
| POST | /v1/knowledge-base/url |
Einzelne URL ingestieren {url}, async 202 {document_id, status}, 422 bei SSRF-Block |
5 |
| POST | /v1/projects/{project}/knowledge-base/site-analysis |
Website-Analyse starten {url, max_pages?} (20/40/80, Default 40). Async 202 {analysis_id, status, poll_url}. 409 wenn für Projekt+Host bereits ein Run aktiv, 422 bei SSRF |
25 |
| GET | /v1/projects/{project}/knowledge-base/site-analysis |
Alle Website-Analyse-Runs des Projekts, paginiert, mit progress_percent |
0 |
| GET | /v1/knowledge-base/site-analysis/{id} |
Run-Status: status, progress_percent, Seiten-Counter, primary_language, document_ids |
0 |
Beispiel:
POST /v1/projects/42/knowledge-base/site-analysis
{"url": "https://example.com", "max_pages": 40}
Credits & Limits
- Datei-Upload / URL-Ingest / Text-Ingest: 5 Credits, abgebucht erst wenn Chunking erfolgreich war (
status: ready) — beifailedkeine Belastung. - Suche: 1 Credit pro Query, abgebucht nur bei
2xx-Antwort. - Website-Analyse: 25 Credits Pauschale, deckt Crawl, Klassifikation, Synthese und Ingest aller erzeugten Dokumente ab. Abgebucht nur bei
completed/partial, nicht beifailed. - Datei-Upload-Limit: 10 MB pro Datei.
- Website-Analyse-Limit:
max_pages5–80 (Default 40); pro Projekt+Host läuft immer nur eine Analyse gleichzeitig (409bei parallelem Start). - Alle Start-Endpoints sind asynchron — Ergebnis per Polling der jeweiligen Status-Endpoints abrufen.
Verwandte Module
- AI Content Editor — konsumiert die Wissensbasis bei der Artikel-Generierung als RAG-Kontext.
- Storylines — Abschnitts-Generierung nutzt dieselbe Retrieval-Pipeline für konsistente Quellen über den ganzen Cluster.