首页|期刊导航|情报杂志|从检索到生成:基于大语言模型的情报合成数据可靠性评测研究

从检索到生成:基于大语言模型的情报合成数据可靠性评测研究OACHSSCD

中文摘要

[目的]针对传统信息资源建设面临样本获取难、隐私壁垒高及响应偏差等问题,探讨大语言模型(LLMs)生成的合成数据作为新型情报源的可靠性。[方法]以我国人口普查公报及综合社会调查数据为基准数据集,构建信息随机生成代理的情报框架,选择DeepSeek-R1大模型生成合成情报数据,采用算法一致性等多维度评估方法,分析生成数据的可靠性。[结果/结论]LLMs在宏观统计特征的事实型情报生成上具有95%的可靠性,但在解释型情报生成中存在响应偏差,难以真实反映用户异质性差异。LLMs将情报获取范式由传统的被动信息获取转向主动信息生成,虽然无法完全取代真实信息源,但是一定程度上可作为情报资源的有效补全。

李毅;王童欣;李浩;米子川

山西财经大学信息学院,太原030006山西财经大学统计学院,太原030006山西财经大学统计学院,太原030006山西财经大学统计学院,太原030006

社会科学

大语言模型情报源评价信息生成代理DeepSeek-R1合成数据提示词工程算法一致性

《情报杂志》 2026 (7)

P.132-141,10

国家社会科学基金重大项目“人工智能大模型的统计理论方法与应用研究”(编号:24&ZD183)山西省基础研究计划杰青项目“海量多源环境下融合数据的隐私保护与共享机制研究”(编号:202303021223010)研究成果。

10.3969/j.issn.1002-1965.2026.07.016

评论