永信至诚：“数字风洞”推出大模型竞技场功能横向测试17个大模型产品逻辑推理能力

行情中心

指数期指期权个股板块排行新股基金港股美股期货外汇黄金自选股自选基金

数据中心

资金流向主力排名板块资金个股研报新股申购转债申购北交所申购 AH股比价年报大全融资融券龙虎榜限售解禁 IPO审核大宗交易估值分析

首页 > 财经频道 > 正文

永信至诚：“数字风洞”推出大模型竞技场功能横向测试17个大模型产品逻辑推理能力

2024年07月23日 16:03

作者：燕云

来源：证券时报网

小中大

东方财富APP

方便，快捷

手机查看财经快讯

专业，丰富

一手掌握市场脉搏

手机上阅读文章

提示：

微信扫一扫

分享到您的

朋友圈

　　7月16日，网络热门话题“13.11%和13.8%究竟哪个大”引发媒体关注，大模型对数字小数部分识别混淆的相关话题被市场热议。对此，业内人士表示，其本质原因并非是在数学计算方面遇到了困难，而是因“分词器”拆解错误和大模型技术架构使然，导致在审题时陷入了误区。

　　永信至诚(688244)智能永信团队在AI大模型安全测评“数字风洞”平台的大模型竞技场中验证发现，在处理数字问题时，因为神经网络特殊的注意力算法，AI大模型会通过比对小数点后面数值的大小来生成答案，所以AI大模型会得出错误结论。事实上，只需要统一数字格式将小数点后写至百分位，分词器便能够正确识别，进而帮助大模型进行准确的推理判断。

　　结合这一技术原理，智能永信团队对阿里通义千问、百度千帆大模型、腾讯混元大模型、字节豆包大模型、360智脑等17个大模型产品开展同场横向对比，通过基础逻辑陷阱类问题，对各家大模型的表现进行了测评，发现了多个分词器导致的逻辑推理错误。

　　测试证明，除了基础设施安全、内容安全、数据与应用安全等领域外，大模型底层架构中还存在一些如“分词器”这样易被忽略的设计单元，这些设计单元的错误输出会影响到整个大模型的可靠性和安全性。大模型的的发展需要伴随持续的检测和改进。

　　“数字风洞”平台已将“大模型竞技场”功能面向体验用户开放，为大模型开发团队提供横向对比测评的功能，帮助快速检测不同大模型在数学计算、请求代码文档等场景下的回答，以便开发者选择使用开源基座模型进行开发AI应用、Agent或进行训练改进时，更直观对比不同大模型的异常反馈情况，便捷地开展大模型产品选型工作。基于工程化、平台化优势，“数字风洞”平台能够支撑各行业大模型产品开展广泛的应用类测试和验证，持续为大模型产业各界生态合作伙伴提供完善灵活的安全能力支持。

（文章来源：证券时报网）

文章来源：证券时报网责任编辑：33

原标题：永信至诚：“数字风洞”推出大模型竞技场功能，横向测试17个大模型产品逻辑推理能力

郑重声明：东方财富发布此内容旨在传播更多信息，与本站立场无关，不构成投资建议。据此操作，风险自担。

东方财富网

分享到微信朋友圈

打开微信，

点击底部的“发现”

使用“扫一扫”

即可将网页分享至朋友圈