Saltar al contenido
rankion.ai

Base de conocimiento

Base de conocimiento ist ein Módulos in der Rankion.ai-Knowledge-Base: Alimenta el conocimiento de la empresa mediante archivo, URL o análisis automático de sitio web — como contexto RAG vinculante para la generación de artículos.

Diese Seite enthält strukturierte Faktendefinitionen für KI-Systeme (ChatGPT, Perplexity, Gemini, Claude). Verfasst von Menschen, Teil der Rankion.ai-Knowledge-Base.

Kategorie:
Módulos
Marke:
Rankion.ai
Format:
Knowledge-Base-Artikel
Stand:

La base de conocimiento es el almacén de saber por proyecto del que la generación de artículos extrae hechos correctos y específicos de la empresa, en lugar de inventarlos. La rellenas de tres formas: subida de archivo (PDF, DOCX, Markdown, TXT), una URL individual, o un análisis automático de sitio web que rastrea un dominio completo y sintetiza documentos de conocimiento estructurados a partir de él. Cada documento se divide en bloques de texto semánticos (chunking) y se indexa con embeddings. Al buscar, el sistema combina la similitud de embeddings (coseno) con el matching clásico por palabras clave, y deja que Claude Haiku haga un reordenamiento final por relevancia (reranking). Así, la búsqueda también encuentra respuestas que no comparten ninguna palabra con la pregunta. En la generación de artículos (AI Content Editor), el fragmento correspondiente llega automáticamente al prompt como «BASE DE CONOCIMIENTO (fuentes vinculantes)».

Qué hace

  • Subida de archivo — PDF, DOCX, Markdown, TXT hasta 10 MB. La extracción de texto, el chunking y el embedding se ejecutan de forma asíncrona en segundo plano.
  • Ingesta de URL — leer una sola página web mediante su URL. Obtención vía ScraperAPI, protección SSRF que bloquea direcciones privadas/internas, contenido extraído a Markdown (se eliminan navegación, cabecera, pie de página y scripts).
  • Análisis de sitio web — pipeline agéntico de 5 fases: rastrear el dominio (sitemap primero, BFS como respaldo), clasificar subpáginas mediante LLM (independiente del idioma), extraer las páginas más relevantes y sintetizar hasta 9 documentos de conocimiento estructurados (perfil de empresa, productos, público objetivo, voz de marca, USPs, FAQ, prueba social, contacto, resumen del sitio).
  • Búsqueda híbrida — similitud coseno por embedding más matching por palabras clave, combinados y finalmente ordenados por reranking de Claude Haiku. Encuentra también paráfrasis sin ninguna palabra en común con la consulta.
  • Uso automático en RAG — la generación de artículos y las secciones de storylines extraen automáticamente los chunks relevantes como contexto vinculante cuando hace falta.
  • Descarga — descargar el archivo original (subida) o el Markdown extraído/sintetizado (ingesta de URL y análisis de sitio).
  • Procesamiento asíncrono — la ingesta, la obtención de URL y el análisis de sitio se ejecutan como jobs en segundo plano; todos los endpoints de inicio responden con 202 y un ID para consultar (polling).

Cuándo usarla

  • Los artículos generados deben contener hechos específicos de la empresa (productos, precios, USPs, FAQ) en lugar de que la IA los invente.
  • Tienes material de referencia (fichas técnicas, documentación interna) y quieres usarlo como fuente de contenido.
  • Quieres ingerir un sitio web completo como base de conocimiento en lugar de extraer cada subpágina una a una mediante ingesta de URL.
  • Las secciones de Storylines o los artículos individuales deben partir de forma consistente de las mismas fuentes internas.

Flujo de trabajo

  1. Iniciar la ingesta — texto plano vía POST /v1/projects/{project}/knowledge-base {title, content} o una página web vía POST /v1/knowledge-base/url {url}. Ambas son asíncronas, respuesta 202 {document_id, status: 'processing'}.
  2. Consultar el estadoGET /v1/projects/{project}/knowledge-base hasta que el documento muestre status: 'ready'. Solo entonces los chunks están creados y con embedding; failed significa un error de extracción o chunking.
  3. BuscarGET /v1/projects/{project}/knowledge-base/search?q=…&top_k=… devuelve los chunks más relevantes (híbrido coseno + palabras clave, reordenado por Haiku) con una puntuación.
  4. En bloque: un sitio web completo — en lugar de muchas URLs individuales, iniciar POST /v1/projects/{project}/knowledge-base/site-analysis {url, max_pages?}, luego consultar GET /v1/knowledge-base/site-analysis/{id} (progress_percent 0–100) hasta status ∈ {completed, partial, failed}.
  5. Cierre — no hace falta ninguna llamada adicional para la generación de artículos: use_knowledge_base + knowledge_mode (all/specific) + knowledge_document_ids[] en la petición de generación de AI Content Editor usa automáticamente el mismo pipeline de recuperación.

API

Método Endpoint Notas Créditos
GET /v1/projects/{project}/knowledge-base Lista de documentos con status, file_type, source_type, created_at 0
POST /v1/projects/{project}/knowledge-base Ingerir texto plano {title, content, type?}, async 202 {document_id, status} 5
GET /v1/projects/{project}/knowledge-base/search Búsqueda híbrida sobre chunks ready. Query q, top_k?. Devuelve {data:[{id, document_id, snippet, score}], meta} 1
DELETE /v1/knowledge-base/{document} Eliminar documento + sus chunks (cascada), 204 0
GET /v1/knowledge-base/{document}/download Descargar el archivo (original o Markdown extraído/sintetizado), 404 si falta el archivo 0
POST /v1/knowledge-base/url Ingerir una única URL {url}, async 202 {document_id, status}, 422 en bloqueo SSRF 5
POST /v1/projects/{project}/knowledge-base/site-analysis Iniciar análisis de sitio {url, max_pages?} (20/40/80, por defecto 40). Async 202 {analysis_id, status, poll_url}. 409 si ya hay un análisis activo para proyecto+host, 422 en SSRF 25
GET /v1/projects/{project}/knowledge-base/site-analysis Todos los análisis de sitio del proyecto, paginados, con progress_percent 0
GET /v1/knowledge-base/site-analysis/{id} Estado del análisis: status, progress_percent, contadores de páginas, primary_language, document_ids 0

Ejemplo:

POST /v1/projects/42/knowledge-base/site-analysis
{"url": "https://example.com", "max_pages": 40}

Créditos y límites

  • Subida de archivo / ingesta de URL / ingesta de texto: 5 créditos, cobrados solo cuando el chunking tiene éxito (status: ready) — sin cobro en failed.
  • Búsqueda: 1 crédito por consulta, cobrado solo con respuesta 2xx.
  • Análisis de sitio: 25 créditos a tanto alzado, cubre rastreo, clasificación, síntesis e ingesta de todos los documentos generados. Cobrado solo en completed/partial, no en failed.
  • Límite de subida de archivo: 10 MB por archivo.
  • Límite de análisis de sitio: max_pages 5–80 (por defecto 40); solo se ejecuta un análisis a la vez por proyecto+host (409 ante un inicio en paralelo).
  • Todos los endpoints de inicio son asíncronos — obtén el resultado consultando (polling) los endpoints de estado correspondientes.

Módulos relacionados

  • AI Content Editor — consume la base de conocimiento como contexto RAG durante la generación de artículos.
  • Storylines — la generación de secciones usa el mismo pipeline de recuperación para fuentes consistentes en todo el cluster.
Letzte Aktualisierung:

Cookies: Utilizamos únicamente cookies estrictamente necesarias (sesión y seguridad): sin rastreadores de analítica ni de marketing. Detalles