永信至诚:“数字风洞”推出大模型竞技场功能,横向测试17个大模型产品逻辑推理能力
来源:证券时报网作者:燕云2024-07-23 15:57

7月16日,网络热门话题“13.11%和13.8%究竟哪个大”引发媒体关注,大模型对数字小数部分识别混淆的相关话题被市场热议。对此,业内人士表示,其本质原因并非是在数学计算方面遇到了困难,而是因“分词器”拆解错误和大模型技术架构使然,导致在审题时陷入了误区。

永信至诚(688244)智能永信团队在AI大模型安全测评“数字风洞”平台的大模型竞技场中验证发现,在处理数字问题时,因为神经网络特殊的注意力算法,AI大模型会通过比对小数点后面数值的大小来生成答案,所以AI大模型会得出错误结论。事实上,只需要统一数字格式将小数点后写至百分位,分词器便能够正确识别,进而帮助大模型进行准确的推理判断。

结合这一技术原理,智能永信团队对阿里通义千问、百度千帆大模型、腾讯混元大模型、字节豆包大模型、360智脑等17个大模型产品开展同场横向对比,通过基础逻辑陷阱类问题,对各家大模型的表现进行了测评,发现了多个分词器导致的逻辑推理错误。

测试证明,除了基础设施安全、内容安全、数据与应用安全等领域外,大模型底层架构中还存在一些如“分词器”这样易被忽略的设计单元,这些设计单元的错误输出会影响到整个大模型的可靠性和安全性。大模型的的发展需要伴随持续的检测和改进。

“数字风洞”平台已将“大模型竞技场”功能面向体验用户开放,为大模型开发团队提供横向对比测评的功能,帮助快速检测不同大模型在数学计算、请求代码文档等场景下的回答,以便开发者选择使用开源基座模型进行开发AI应用、Agent或进行训练改进时,更直观对比不同大模型的异常反馈情况,便捷地开展大模型产品选型工作。基于工程化、平台化优势,“数字风洞”平台能够支撑各行业大模型产品开展广泛的应用类测试和验证,持续为大模型产业各界生态合作伙伴提供完善灵活的安全能力支持。(燕云)

校对:杨舒欣

责任编辑: 孙孝熙
声明:证券时报力求信息真实、准确,文章提及内容仅供参考,不构成实质性投资建议,据此操作风险自担
下载“证券时报”官方APP,或关注官方微信公众号,即可随时了解股市动态,洞察政策信息,把握财富机会。
网友评论
登录后可以发言
发送
网友评论仅供其表达个人看法,并不表明证券时报立场
暂无评论
为你推荐
时报热榜
换一换
    热点视频
    换一换