大模型幻觉成应用落地难题评测显示文心一言解决幻觉应对能力好

首页 > AI资讯 > 最新资讯 > 大模型幻觉成应用落地难题评测显示文心一言解决幻觉应对能力好

大模型幻觉成应用落地难题评测显示文心一言解决幻觉应对能力好

新火种 2023-11-17

　　大模型的“幻觉”问题，是其行业落地的核心挑战之一。例如幻觉会影响生成内容的可靠性，对于法律、金融、医疗等专业要求高的领域，将难以完成实际场景任务。因此，大模型幻觉问题也被认为是制约大模型广泛应用的一大难题。近日，复旦大学与上海人工智能实验室构建了针对中文大模型的幻觉评测数据集HalluQA，对业界主流的大模型进行评估。

　　HalluQA采用无幻觉率来评估大模型的优劣。无幻觉率越高代表模型幻觉越低，事实准确性越高。评测的24个主流大模型中包括百度文心一言ERNIE-Bot、百川Baichuan、智谱ChatGLM、阿里通义千问和GPT-4等。

中文大模型幻觉评测数据集HalluQA对24个主流大模型进行评测

　　从评测结果来看，解决幻觉问题对大模型来说尚有困难，有18个模型的无幻觉率低于50%。在幻觉消除上，具备检索增强能力的大模型优势明显，在所有模型评测中，文心一言在整体幻觉问题解决方面表现突出，排名第一，整体无幻觉率为69.33%。而GPT-4整体无幻觉率为53.11%，排名第六。

HalluQA：不同类型模型在不同类型的问题上的平均非幻觉率

　　行业普遍认为，幻觉问题对于大模型在多个领域的落地都可能产生严重影响，包括客户服务、金融服务、法律决策和医疗诊断等。因此解决幻觉问题越好的大模型，才具备更强的产业落地价值。

（文章来源：经济参考网）

Tags:

GPT 幻觉难题

免责声明: 本文所包含的观点仅代表作者个人看法，不代表新火种的观点。在新火种上获取的所有信息均不应被视为投资建议。新火种对本文可能提及或链接的任何项目不表示认可。交易和投资涉及高风险，读者在采取与本文内容相关的任何行动之前，请务必进行充分的尽职调查。最终的决策应该基于您自己的独立判断。新火种不对因依赖本文观点而产生的任何金钱损失负任何责任。

大模型幻觉成应用落地难题评测显示文心一言解决幻觉应对能力好

开源大模型新王干翻GPT-4o，新技术可纠正自己幻觉，数学99.2分刷爆测试集

40年图灵机难题被业余玩家攻破，陶哲轩：软件辅助证明改变规则

对话IJCAI2024大会主席张成奇：克服了幻觉，大模型就不够「靓丽」

突破智能驾驶技术难题，NIRADynamics软件优化全轮动系统提升自适应巡航控制可靠性

200万，华为宣布2024年奥林帕斯难题悬红

热门文章

0326东吴宏观股指每日观点|市场弱势震荡磷化工领涨

将设人工智能、机器人等“专场”科创板年报业绩说明会看点多

L3上路倒计时？工信部加快推进智能网联车规划产业基建+商业化迎来关键节点

这家医院智慧医疗再升级实现DeepSeek大模型本地化全信创部署

ChatGPT引爆“吉卜力”风格图像生成浪潮同时激发AI违法争议

AI战略锁定增长确定性，粉笔2024年净利润2.4亿元

山西今年将对农用无人驾驶航空器进行购置补贴

【明日主题前瞻】又一巨头切入具身智能领域，机构称具身智能有望成为经济增长新引擎

南方电网人工智能科技公司增资至4.4亿元