> ## Documentation Index
> Fetch the complete documentation index at: https://docs.counso.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 文本块与文档

文档是存入数据源的内容单位，使用唯一的 `document_id` 标识，可以通过 Counso 界面或 API 添加。插入或更新文档时，Counso 会处理内容并将文本切分成文本块，便于搜索时取回相关段落，而不必把整份文档都发送给模型。

Counso 会先清理重复空格，再将文档切分为不超过已配置 `max_chunk_size` token 的文本块。每个文本块使用数据源所设的模型生成向量（默认为 `text-embedding-3-large`），并连同文档元数据和原始文本块编入索引。请将相关信息放在一起并使用清晰标题，让检索到的段落保留上下文。

执行语义搜索时，Counso 会使用数据源的嵌入模型将查询向量化，检索相关文本块，再按原始文档归组。因此，返回的文档可能只包含匹配段落，而不是全文。结果按每份文档中最高的匹配文本块分数排序。

这种结构支持检索增强生成（RAG）：Agent 从较大的资料集合中取用相关段落来回答请求。文档的插入、替换和删除行为，请参阅[数据源](/zh-cn/docs/developer-platform/core-concepts/datasources)。
