英伟达发布全新 AI 音频模型 Fugatto
编译/前方智能
英伟达近日推出了一款名为 Fugatto(全称为 Foundational Generative Audio Transformer Opus 1)的 AI 音频模型。这款模型不仅能通过文字提示生成音乐和音效,还能对现有音频进行修改和转换,创造出前所未有的声音组合。
图源:英伟达
据英伟达介绍,Fugatto 具备多项独特功能,比如可以将钢琴演奏的音乐转换为人声演唱,能够调整语音的口音和情绪,甚至可以创造出"尖叫的萨克斯"或"犬吠般的小号声"等超现实音效。该模型采用了创新的 ComposableART 技术,能够将训练过程中分别出现的音频特征进行组合,从而产生全新的声音效果。
在技术层面,研究团队使用了来自全球多个开源数据集的约 2000 万个音频样本进行训练,形成了一个拥有 25 亿参数的大规模模型。该项目由来自印度、巴西、中国、约旦和韩国等多个国家的研究人员共同开发,这种多元化的团队构成也使得模型在处理多语言和多重口音方面表现出色。
英伟达应用深度学习研究副总裁 Bryan Catanzaro 表示,生成式 AI 技术将为音乐、游戏和普通创作者带来全新的创作可能性。不过,考虑到生成式技术可能带来的潜在风险,英伟达目前尚未计划对外发布这项技术。
原文标题 : 英伟达发布全新 AI 音频模型 Fugatto
最新活动更多
-
11月28日立即报名>>> 2024工程师系列—工业电子技术在线会议
-
12月12日火热报名中>>> STM32全球线上峰会
-
12月19日立即报名>> 【线下会议】OFweek 2024(第九届)物联网产业大会
-
即日-12.26立即报名>>> 【在线会议】村田用于AR/VR设计开发解决方案
-
即日-12.26火热报名中>> OFweek2024中国智造CIO在线峰会
-
即日-2025.8.1立即下载>> 《2024智能制造产业高端化、智能化、绿色化发展蓝皮书》
推荐专题
发表评论
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论