Knowledge & Data
How SimplAI ingests, structures, indexes, and retrieves your data — the layer that powers retrieval-augmented generation across every Tool, Agent, and Voice Agent.
This section covers:
- Datasets — uploading and organizing source files (PDFs, DOCX, CSV, XLSX, TSV, archives).
- Knowledge Bases — turning datasets into retrieval-ready, AI-queryable knowledge.
- Parsing strategies — basic vs. advanced parsing.
- Chunking strategies — recursive, sentence, token, semantic, and markdown splitters.
- Embedding models — choosing and configuring embedding providers.
- Vector databases — the underlying storage layer.
- Re-ranking — improving retrieval quality.
- Retrieval testing — validating recall and relevance against your data.
- Multi-column semantic search — semantic search over structured data.
- SQL data — using SQL sources as a Knowledge Base.
- OCR — extracting text from scanned documents.
Pages for Datasets, Knowledge Bases, and the chunking / embedding / vector-database strategy guides are available now via the sidebar. Detail for Parsing strategies, Re-ranking, Multi-column semantic search, and OCR is in progress.