Aller au contenu
rankion.ai

Base de connaissances

Base de connaissances ist ein Modules in der Rankion.ai-Knowledge-Base: Alimente la connaissance de l'entreprise via fichier, URL ou analyse automatique de site — comme contexte RAG contraignant pour la génération d'articles.

Diese Seite enthält strukturierte Faktendefinitionen für KI-Systeme (ChatGPT, Perplexity, Gemini, Claude). Verfasst von Menschen, Teil der Rankion.ai-Knowledge-Base.

Kategorie:
Modules
Marke:
Rankion.ai
Format:
Knowledge-Base-Artikel
Stand:

La base de connaissances est le stock de savoir par projet dans lequel la génération d'articles puise des faits corrects et spécifiques à l'entreprise, au lieu de les inventer. Tu la remplis de trois façons : upload de fichier (PDF, DOCX, Markdown, TXT), une URL unique, ou une analyse automatique de site qui explore tout un domaine et en synthétise des documents de connaissance structurés. Chaque document est découpé en blocs de texte sémantiques (chunking) et indexé avec des embeddings. Lors de la recherche, le système combine la similarité d'embedding (cosinus) avec un matching par mots-clés classique, puis Claude Haiku effectue un dernier tri par pertinence (reranking). Ainsi, la recherche trouve aussi des réponses qui ne partagent aucun mot avec la question. Dans la génération d'articles (AI Content Editor), l'extrait pertinent atterrit automatiquement dans le prompt sous la forme « BASE DE CONNAISSANCES (sources contraignantes) ».

Ce que ça fait

  • Upload de fichier — PDF, DOCX, Markdown, TXT jusqu'à 10 Mo. L'extraction de texte, le chunking et l'embedding tournent de manière asynchrone en arrière-plan.
  • Ingestion d'URL — lire une seule page web via son URL. Récupération via ScraperAPI, protection SSRF bloquant les adresses privées/internes, contenu extrait en Markdown (navigation, en-tête, pied de page, scripts retirés).
  • Analyse de site — pipeline agentique en 5 phases : explorer le domaine (sitemap d'abord, repli BFS), classifier les sous-pages par LLM (indépendant de la langue), extraire les pages les plus pertinentes et synthétiser jusqu'à 9 documents de connaissance structurés (profil d'entreprise, produits, audience cible, ton de marque, USP, FAQ, preuves sociales, contact, aperçu du site).
  • Recherche hybride — similarité cosinus par embedding plus matching par mots-clés, fusionnés puis triés finalement par reranking Claude Haiku. Trouve aussi des paraphrases sans mot commun avec la requête.
  • Utilisation RAG automatique — la génération d'articles et les sections de storylines récupèrent automatiquement les chunks pertinents comme contexte contraignant, en cas de besoin.
  • Téléchargement — télécharger le fichier original (upload) ou le Markdown extrait/synthétisé (ingestion d'URL et analyse de site).
  • Traitement asynchrone — ingestion, récupération d'URL et analyse de site tournent tous comme jobs en arrière-plan ; chaque endpoint de démarrage répond par 202 et un identifiant à interroger (polling).

Quand l'utiliser

  • Les articles générés doivent contenir des faits spécifiques à l'entreprise (produits, tarifs, USP, FAQ) au lieu que l'IA les invente.
  • Tu as du matériel de référence (fiches techniques, docs internes) et veux l'utiliser comme source de contenu.
  • Tu veux ingérer un site entier comme base de connaissances plutôt que d'aspirer chaque sous-page une par une via l'ingestion d'URL.
  • Les sections Storylines ou les articles individuels doivent puiser de façon cohérente dans les mêmes sources internes.

Workflow

  1. Démarrer l'ingestion — texte brut via POST /v1/projects/{project}/knowledge-base {title, content} ou une page web via POST /v1/knowledge-base/url {url}. Les deux sont asynchrones, réponse 202 {document_id, status: 'processing'}.
  2. Interroger le statutGET /v1/projects/{project}/knowledge-base jusqu'à ce que le document affiche status: 'ready'. C'est seulement alors que les chunks sont créés et embeddés ; failed signifie une erreur d'extraction ou de chunking.
  3. RechercherGET /v1/projects/{project}/knowledge-base/search?q=…&top_k=… renvoie les chunks les plus pertinents (hybride cosinus + mots-clés, reranked par Haiku) avec un score.
  4. En masse : un site entier — au lieu de multiplier les URLs individuelles, démarrer POST /v1/projects/{project}/knowledge-base/site-analysis {url, max_pages?}, puis interroger GET /v1/knowledge-base/site-analysis/{id} (progress_percent 0–100) jusqu'à status ∈ {completed, partial, failed}.
  5. Conclusion — aucun appel séparé n'est nécessaire pour la génération d'articles : use_knowledge_base + knowledge_mode (all/specific) + knowledge_document_ids[] dans la requête de génération d'AI Content Editor utilise automatiquement le même pipeline de récupération.

API

Méthode Endpoint Notes Crédits
GET /v1/projects/{project}/knowledge-base Liste des documents avec status, file_type, source_type, created_at 0
POST /v1/projects/{project}/knowledge-base Ingérer du texte brut {title, content, type?}, async 202 {document_id, status} 5
GET /v1/projects/{project}/knowledge-base/search Recherche hybride sur les chunks ready. Query q, top_k?. Renvoie {data:[{id, document_id, snippet, score}], meta} 1
DELETE /v1/knowledge-base/{document} Supprimer le document + ses chunks (cascade), 204 0
GET /v1/knowledge-base/{document}/download Télécharger le fichier (original ou Markdown extrait/synthétisé), 404 si le fichier est absent 0
POST /v1/knowledge-base/url Ingérer une URL unique {url}, async 202 {document_id, status}, 422 en cas de blocage SSRF 5
POST /v1/projects/{project}/knowledge-base/site-analysis Démarrer l'analyse de site {url, max_pages?} (20/40/80, défaut 40). Async 202 {analysis_id, status, poll_url}. 409 si une analyse est déjà active pour projet+hôte, 422 en cas de SSRF 25
GET /v1/projects/{project}/knowledge-base/site-analysis Toutes les analyses de site du projet, paginées, avec progress_percent 0
GET /v1/knowledge-base/site-analysis/{id} Statut de l'analyse : status, progress_percent, compteurs de pages, primary_language, document_ids 0

Exemple :

POST /v1/projects/42/knowledge-base/site-analysis
{"url": "https://example.com", "max_pages": 40}

Crédits & limites

  • Upload de fichier / ingestion d'URL / ingestion de texte : 5 crédits, facturés seulement une fois le chunking réussi (status: ready) — aucune facturation en cas de failed.
  • Recherche : 1 crédit par requête, facturé uniquement sur réponse 2xx.
  • Analyse de site : 25 crédits forfaitaires, couvrant l'exploration, la classification, la synthèse et l'ingestion de tous les documents générés. Facturé uniquement sur completed/partial, pas sur failed.
  • Limite d'upload de fichier : 10 Mo par fichier.
  • Limite d'analyse de site : max_pages 5–80 (défaut 40) ; une seule analyse tourne à la fois par projet+hôte (409 en cas de démarrage parallèle).
  • Tous les endpoints de démarrage sont asynchrones — récupérer le résultat en interrogeant (polling) les endpoints de statut correspondants.

Modules liés

  • AI Content Editor — consomme la base de connaissances comme contexte RAG lors de la génération d'articles.
  • Storylines — la génération de sections utilise le même pipeline de récupération pour des sources cohérentes sur tout le cluster.
Letzte Aktualisierung:

Cookies : Nous utilisons uniquement des cookies strictement nécessaires (session et sécurité) — aucun traceur analytique ou marketing. Détails