解放军医学院学报

国内刊号:10-1117/R

国际刊号:2095-5227

解放军医学院学报杂志2025年第10期:国内大语言模型在烧伤辅助诊疗多跳推理任务中的性能评估与比较

发布日期:

作者:张文一, 郭九宫, 郑金光, 王庆梅, 李林

关键词:大语言模型, 多跳推理, 烧伤诊疗, 人工智能, 临床决策支持

背景烧伤救治要求迅速整合多维临床信息以支持准确决策,多跳推理技术在这一过程中扮演关键角色。目的评估DeepSeek R1、DeepSeek V3、豆包和KiMi四种国内大语言模型在烧伤辅助诊疗多跳推理任务中的性能差异,为临床和急救环境中大模型的选型与优化提供理论依据。方法从解放军总医院2023年1月—2025年2月出院的烧伤病例中随机抽取30例。统一输入患者基本信息、主诉、现病史、既往史、个人史及体格与辅助检查数据,通过四类模型确定疾病诊断。3名专家采用Likert 5分盲评对诊断结果的准确性进行评估。总体比较采用配伍组方差分析,亚组(问题字数、烧伤部位、面积、严重程度)采用Mann-Whitney U检验,并利用混合效应模型评估各大语言模型与亚组因素的交互作用。结果专家一致性评分Cronbach’s Alpha达0.809。总体上,DeepSeek R1得分为(4.2±0.62),显著高于DeepSeek V3(2.4±1.06)、豆包(3.2±1.31)和KiMi(1.6±0.86)(P<0.001)。亚组分析显示,2000字以下和2000字及以上组、单部位烧伤和多部位烧伤组、10%以下烧伤和10%以上烧伤面积组、深Ⅱ度以下和深Ⅱ度以上烧伤程度组中DeepSeek R1均表现优异;混合效应模型表明,问题字数、烧伤部位数量与烧伤面积对模型得分存在显著交互效应(分别P=0.006、0.007、0.001)。结论国内大模型在烧伤辅助诊疗多跳推理任务中存在显著性能差异,其中DeepSeek R1表现最佳,凸显了多跳推理技术在复杂临床信息整合与快速决策中的应用前景,为临床急救中大模型的优化提供了重要参考。

来源:2025年第10期

《解放军医学院学报》期刊编辑部

查看解放军医学院学报杂志2025年第10期