大语言模型在口腔执业医师考前学习中的应用比较研究OA
目的比较不同的大语言模型(LLM)在口腔执业医师考前学习中的应用表现,重点评估其在答题、解析和教学效果方面的差异,为LLM在口腔医学教育中的应用提供参考。方法设计3个评估场景,包括选择正确答案、答案解析和对抗性测试。选择DeepSeek-R1、通义千问2.5-MAX、豆包1.5 Pro、星火Spark-X1、文心一言4.0 Turbo、GPT-4o和华西口腔智联大模型进行对比测试,评估的指标为准确率、净正确率和教学效果评分。结果在选择正确答案场景方面,所有LLM均达到了及格线,华西口腔智联大模型的准确率最高(84%)。在答案解析场景方面,华西口腔智联大模型的解析净正确率最高(92%),其次为DeepSeek-R1(89%)。在教学效果评分中,华西口腔智联大模型在相关性、实用性和清晰度方面得分最高,GPT-4o在简洁性方面分数最高。在对抗性测试场景下,华西口腔智联大模型和DeepSeek-R1分别在准确率和净正确率方面下降幅度最小。结论在口腔执业医师考前学习应用场景中,针对口腔医学进行知识增强的LLM(如华西口腔智联大模型)表现优于以中文语料库为核心预训练的推理LLM(如DeepSeek-R1),优于以英文语料库为核心预训练的LLM(如GPT-4o)。在对抗性测试中,所有模型的表现均有所下降。未来相关模型的研究可针对评估中表现不足之处进行优化,提升其在口腔执业医师考前学习中的应用效果。
庞潇;刘畅;范嘉豪;黄艳;孙亚楠;刘济远
口腔疾病防治全国重点实验室、国家口腔医学中心、口腔疾病国家临床医学研究中心、四川大学华西口腔医院信息管理部,成都610041口腔疾病防治全国重点实验室、国家口腔医学中心、口腔疾病国家临床医学研究中心、四川大学华西口腔医院信息管理部,成都610041四川大学计算机学院,成都610065口腔疾病防治全国重点实验室、国家口腔医学中心、口腔疾病国家临床医学研究中心、四川大学华西口腔医院信息管理部,成都610041四川大学计算机学院,成都610065口腔疾病防治全国重点实验室、国家口腔医学中心、口腔疾病国家临床医学研究中心、四川大学华西口腔医院信息管理部,成都610041
医药卫生
口腔医学大语言模型口腔执业医师考试口腔医学教育
《华西口腔医学杂志》 2026 (4)
P.614-624,11
中国高校产学研创新基金(2024XL004)四川省科技计划资助(2025ZNSFSC0459)四川大学人工智能赋能创新型实践教育综合改革研究专项(2024-80)。
评论