document_id 标识,可以通过 Counso 界面或 API 添加。插入或更新文档时,Counso 会处理内容并将文本切分成文本块,便于搜索时取回相关段落,而不必把整份文档都发送给模型。
Counso 会先清理重复空格,再将文档切分为不超过已配置 max_chunk_size token 的文本块。每个文本块使用数据源所设的模型生成向量(默认为 text-embedding-3-large),并连同文档元数据和原始文本块编入索引。请将相关信息放在一起并使用清晰标题,让检索到的段落保留上下文。
执行语义搜索时,Counso 会使用数据源的嵌入模型将查询向量化,检索相关文本块,再按原始文档归组。因此,返回的文档可能只包含匹配段落,而不是全文。结果按每份文档中最高的匹配文本块分数排序。
这种结构支持检索增强生成(RAG):Agent 从较大的资料集合中取用相关段落来回答请求。文档的插入、替换和删除行为,请参阅数据源。