来源:互联网 更新时间:2026-08-18 14:16
最近,中文医疗大模型开放评测平台MedBench迎来了一次重要升级。新增大模型API评测方式,同时针对开放性问答评估环节,引入了医学专家人工标注“给分点”机制。这意味着,评测结果的专业性和公正性有了更扎实的保障。

模型能力评测不只是技术进步的标尺,更是推动模型迭代与优化的驱动器。MedBench由上海人工智能实验室与上海市数字医学创新中心联合多家机构推出。作为医疗领域的专业评测基准,它已加入司南大模型开源开放评测体系(OpenCompass)。自发布以来,MedBench已为387个医疗大模型提供了评测服务。
相关研究成果论文《MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models》近期已刊发于全球计算机系统领域期刊《Big Data Mining and Analytics》(中科院一区期刊,近两年平均影响因子10.6)。
依托专业医疗机构的专家经验和知识储备,MedBench设置了五大评测维度:医学语言理解、医学语言生成、医学知识问答、复杂医学推理、医疗安全和伦理。这些维度为医疗大模型的研发和应用实践提供了清晰的指标参考。近期,上海AI实验室联合团队对MedBench进行了全面升级,新增模型API接入评测,并优化了开放性问答的评估指标——由医学专家人工标准评测给分点,进一步确保结果的专业性和公正性。同时,评测数据集、评测方法以及系统功能也得到扩充和升级,提供了更丰富、更贴近真实医疗实践的场景。
MedBench集纳了约30万道中文医疗专业测评题目,覆盖医学考试、医学问答、患者服务、医学问诊、病历分析、病历生成和辅助诊断等场景,涵盖多个临床科室。五个评估维度全面考察模型能力。评测过程采用全自动化、云基础架构,有效解决了标准化和答案泄露问题。更巧妙的是,动态评估机制通过将选项循环打乱和随机提示匹配,显著提高了评估的科学性和准确性。
自发布以来,MedBench即面向全球开放,与各界共同推进医疗大语言模型评测体系的全面、专业、互认。截至目前,已有387个医疗大模型通过平台获得能力指标和提升方向参考。上海交通大学医学院附属瑞金医院、上海交通大学医学院附属新华医院、四川大学华西医院、广州实验室、上海交通大学、复旦大学、华东理工大学、同济大学、香港中文大学(深圳)、上海市卫生健康统计中心、华东师范大学等机构陆续加入平台共建,汇聚行业经验,助力医疗智慧化转型。基于医疗大模型评测领域的积累与实践,上海AI实验室与上海市卫生健康统计中心联合支持了《第二届全国数字健康创新应用大赛》相关成果评估工作,加速人工智能与医疗的交叉研究与协同创新。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
腾讯ima怎么创建共享知识库?
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
2026年三角洲行动账号交易指南:5大交易平台对比与安全选购建议
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
Windy卫星云图怎么看?云层变化识别技巧
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
网络热词我黑切呢是什么意思
五菱星光L六座新能源SUV上市:三版可选,中配12.28
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc