Skip to main content
语言模型生成的是可能性较高的文字,本身并不是精确计数器或电子表格计算引擎。它可能给出听起来合理的答案,却漏掉长文件中的词语、数据行或字段关系。精确总数和逐条记录结论都应当核算验证。

统计文档中的词语

“这个短语在所有文件中出现了多少次?”需要扫描完整文件范围并精确匹配。模型一次可能看不到长来源的全部内容,传入的文字也可能被拆成多个片段。应先明确来源和统计范围;需要精确计数时,优先使用确定性的文本搜索或计数功能。

查询 CSV 和表格

表格的行列关系在转换成文本片段后可能丢失。语义搜索适合查找相关段落,但返回的可能只是看起来最相关的几行,而不是全部记录。因此,它不适合对完整数据集做精确计数、求和、平均、筛选或比较。 结构化分析可以在 Agent Builder 提供该能力时使用 Query Tables(查询表格)。它能在生成回答前用 SQL 查询受支持的表。选择正确的表,并说清日期范围、筛选条件和所需计算。若重复值、空值或格式差异可能影响结果,还应对照来源检查查询返回的行或总数。详见表格查询 非结构化资料中的含义和背景可用搜索;结构化行数据的计算可用表格查询。如果当前没有所需查询能力,应准备一份可核验的表格,再用合适的电子表格或数据库工具计算,不要依赖听起来流畅的猜测。