蚂蚁数科AI数据合成与生产技术平台在乌镇“首发”
2024年11月19日 19:30
来源: 中国财富网
东方财富APP

方便,快捷

手机查看财经快讯

专业,丰富

一手掌握市场脉搏

手机上阅读文章

提示:

微信扫一扫

分享到您的

朋友圈

  中国财富网讯(贾垚)11月19日,行业大模型、具身智能、算力、芯片、数据合成等10项首发成果在2024年世界互联网大会乌镇峰会登台路演。其中蚂蚁数科申报的首发成果AI数据合成与生产技术平台(AI Generated Data,以下简称“AIGD”),因其专注于“数据合成”,而获得了广泛关注。

  当下,AI 发展正面临着高质量数据短缺的问题。近年来,伴随着大模型技术的快速发展,机器学习也正从“以模型为中心”转向“以数据为中心”,高质量数据可以更好地模拟客观世界,提升模型的准确性和稳定性。

  业内人士普遍认为,“高质量数据”是AI大模型深入到产业的重要基础,没有好的数据做支撑,一切AI应用都是“空中楼阁”。Epoch AI Research研究团队预测,“到 2026年,现存的用于AI模型训练的高质量语言数据将耗尽。”

  蚂蚁数科AI科技技术负责人、蚂蚁天玑实验室主任李哲现场表示,“未来的AI应用需要大量稀缺且难以获取的长尾数据,如自动驾驶中的极端天气与极端路况数据,具身智能训练所需要的复杂场景数据。在此背景下,数据合成将成为关键。”

  据美国IT调研与咨询服务公司Gartner预测,2024年,60%的AI数据将是合成数据,被用于模拟、预测场景和降低风险;到2030年,合成数据将成为AI模型的主要训练数据来源。

  李哲介绍,“数据合成”是蚂蚁数科AIGD平台的主要功能之一,可通过大规模合成互联网所不覆盖的高质量、高价值垂直语料数据,帮助科技厂商进行AI模型训练。同时,AIGD还具备PB级数据生产能力,支持数据从生成到训练全流程自动化处理,自动化率达到 80%,极大程度上提高了数据处理的效率和质量。

  李哲进一步介绍,平台自研的15余种数据合成工具,目前可以合成涵盖图片、视频、3D模型、多模态图文视频对、多轮对话、语音信号、心率脑电信号、结构化交易数据等多模态数据,以满足多种应用场景下的AI模型训练需求。

  除了“数据合成”,该平台还具备数据标注、质检等能力。李哲表示,在数据标注方面,通过人机协同进行标注,人工智能算法能够自动识别和预处理大部分基础信息,预标注模型依赖人工标注量降低了70%以上。在数据质检方面,平台会根据元信息支持不同粒度的数据质量统计,最大程度理解数据,保证合成及标注后的数据符合预期质量要求。

  据了解,蚂蚁数科是一家ToB 服务的科技公司,旗下主要包含“企业用云服务”“企业区块链服务”“企业AI服务”三大核心业务。今年以来,蚂蚁数科陆续迭代发布了多款AI产品,包括大模型安全评测与防御产品“蚁天鉴”、反深伪造产品 ZOLOZ Deeper等。

  李哲总结道,“我们即将迎来AI服务产业的黄金年代,蚂蚁数科将会坚定AI ToB领域的投入,让AI深入千行百业。”

(文章来源:中国财富网)

文章来源:中国财富网 责任编辑:3
原标题:蚂蚁数科AI数据合成与生产技术平台在乌镇“首发”
郑重声明:东方财富发布此内容旨在传播更多信息,与本站立场无关,不构成投资建议。据此操作,风险自担。
举报
分享到微信朋友圈

打开微信,

点击底部的“发现”

使用“扫一扫”

即可将网页分享至朋友圈

扫描二维码关注

东方财富官网微信


扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500