Skip to main content

Knowledge & Data

How SimplAI ingests, structures, indexes, and retrieves your data — the layer that powers retrieval-augmented generation across every Tool, Agent, and Voice Agent.

This section covers:

  • Datasets — uploading and organizing source files (PDFs, DOCX, CSV, XLSX, TSV, archives).
  • Knowledge Bases — turning datasets into retrieval-ready, AI-queryable knowledge.
  • Parsing strategies — basic vs. advanced parsing.
  • Chunking strategies — recursive, sentence, token, semantic, and markdown splitters.
  • Embedding models — choosing and configuring embedding providers.
  • Vector databases — the underlying storage layer.
  • Re-ranking — improving retrieval quality.
  • Retrieval testing — validating recall and relevance against your data.
  • Multi-column semantic search — semantic search over structured data.
  • SQL data — using SQL sources as a Knowledge Base.
  • OCR — extracting text from scanned documents.

Pages for Datasets, Knowledge Bases, and the chunking / embedding / vector-database strategy guides are available now via the sidebar. Detail for Parsing strategies, Re-ranking, Multi-column semantic search, and OCR is in progress.