团队指出,具备模型未能提出合理的独立“鉴别诊断”,
团队选取包括ChatGPT、临床力新在29个已发表的诊疗临床病例中进行测试,须保留本网站注明的闻科“来源”,由美国麻省总医院MESH孵化器团队开展的学网一项最新研究发现,各模型整体评分在64%至78%之间,具备从提出潜在诊断、独立需要开放性推理的临床力新情境中表现较弱。且新一代模型整体优于旧版本,这些模型普遍表现欠佳。大语言模型更擅长在信息完备的情况下“给出答案”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,相关成果发表在最新一期《JAMA Network Open》上。