max_chunk_size 将文本切块、生成向量,并将向量与文档元数据和原始文本一起编入索引。默认嵌入模型为 text-embedding-3-large;工作区支持时也可使用其他模型。
插入或更新文档时,请使用稳定的 document_id。将 baseUrl 设为 https://app.counso.ai 后,upsert 路由为 POST {baseUrl}/api/v1/w/{wId}/spaces/{spaceId}/data_sources/{dsId}/documents/{documentId},JSON 请求体包含 text。新 ID 会创建文档;已存在的 ID 会替换旧版本及其索引文本块。搜索路由为 GET {baseUrl}/api/v1/w/{wId}/spaces/{spaceId}/data_sources/{dsId}/search。删除文档会移除关联文本块;删除数据源会移除其中所有文档和文本块。执行删除前请确认目标。
批量导入目录时,可用脚本读取 PDF、TXT 和 Markdown 文件,并逐份 upsert。下面的示例使用 Python、requests 和 pdftotext;工作区、Space、数据源和凭据通过环境变量提供。示例以文件的相对路径生成文档 ID,因此不同文件夹里的同名文件仍有各自的标识。
upload.py,安装 requests 和 pdftotext,设置上述环境变量,然后运行 python upload.py <待导入目录>。
逐份检查响应,并在 Counso 中抽查索引内容。默认 baseUrl 为 https://app.counso.ai,其他环境请替换为相应基础地址。
Agent 搜索数据源时,Counso 会将查询向量化并检索相关文本块。结果按原始文档归组,让 Agent 可以使用相关段落,而不用将所有完整文档都放入上下文。这种检索方式称为检索增强生成(RAG)。分块和结果排序方式见文本块与文档。