官方网站-首页官方网站-首页

小米声音理解大模型 MiDashengLM-7B 发布并全量开源,22 个公开评测集刷新最好成绩

形状
形状
形状
形状
形状
形状
形状
形状

【导语】8月4日,小米公司正式发布了自研的声音理解大模型MiDashengLM-7B,并决定全量开源该模型。据官方介绍,MiDashengLM-7B在速度和精度上均实现了显著突破,刷新了多项评测记录。该模型基于创新的训练策略,能够统一理解语音、环境声音和音乐,为小米的“人车家全生态”战略提供关键技术支撑。通过自然语言交互,MiDashengLM-7B能为用户提供更人性化的沟通和反馈,未来还将进一步优化计算效率,拓展更多功能。

小米声音理解大模型 MiDashengLM-7B 发布并全量开源,22 个公开评测集刷新最好成绩

  8 月 4 日消息,小米自研声音理解大模型 MiDashengLM-7B 正式发布,并全量开源

  据小米官方介绍,MiDashengLM-7B 速度精度上实现双突破:单样本首 Token 延迟仅为同类模型 1/4、同显存下并发超 20 倍,在 22 个公开评测集上刷新多模态大模型最好成绩(SOTA)

  MiDashengLM-7B 基于 Xiaomi Dasheng 作为音频编码器和 Qwen2.5-Omni-7B Thinker 作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解。

  2024 年,小米发布的 Xiaomi Dasheng 声音基座模型在国际上首次突破 AudioSet 50+ mAP,在 HEAR Benchmark 环境声、语音、音乐三大领域建立领先优势(shì)并(bìng)保(bǎo)持(chí)至(zhì)今(jīn)。

  Xiaomi Dasheng 在(zài)小(xiǎo)米(mǐ)的(de)智(zhì)能(néng)家(jiā)居(jū)和(hé)汽(qì)车(chē)座(zuò)舱(cāng)等(děng)场(chǎng)景(jǐng)有(yǒu)超(chāo)过(guò) 30 项(xiàng)落(luò)地(de)应(yīng)用(yòng)。行(xíng)业(yè)首(shǒu)发(fā)的(de)车(chē)外(wài)唤(huàn)醒(xǐng)防(fáng)御(yù)、手(shǒu)机(jī)音(yīn)箱(xiāng)全天(tiān)候(hou)监(jiān)控(kòng)异(yì)常(cháng)声(shēng)音(yīn)、“打(dǎ)个(gè)响(xiǎng)指(zhǐ)”环(huán)境(jìng)音(yīn)关联(lián) IoT 控(kòng)制(zhì)能(néng)力(lì),以(yǐ)及(jí)小(xiǎo)米(mǐ) YU7 上(shàng)搭(dā)载(zài)的(de)增(zēng)强(qiáng)哨(shào)兵(bīng)模(mó)式(shì)划(huà)车(chē)检(jiǎn)测(cè)等(děng),背(bèi)后(hòu)都(dōu)有(yǒu) Xiaomi Dasheng 作(zuò)为(wèi)核(hé)心(xīn)算(suàn)法(fǎ)的(de)赋(fù)能。

  MiDashengLM 的(de)训(xun)练(liàn)数(shù)据(jù)由(yóu) 100% 的(de)公(gōng)开(kāi)数(shù)据(jù)构(gòu)成(chéng),模(mó)型(xíng)以(yǐ)宽(kuān)松(sōng)的(de) Apache License 2.0 发(fā)布(bù),同(tóng)时(shí)支(zhī)持(chí)学(xué)术(shù)和(hé)商业应用。

  小米表示,不同于 Qwen2.5-Omni 等未公开训练数据细节的模型,MiDashengLM 完整公开了 77 个数据源的详细配比,技术报告中详细介绍了从音频编码器预训练到指令微调的全流程(chéng)。

  作(zuò)为(wèi)小(xiǎo)米(mǐ)“人(rén)车(chē)家(jiā)全生(shēng)态(tài)”战(zhàn)略(è)的(de)关键技(jì)术(shù),MiDashengLM 通(tōng)过(guò)统(tǒng)一(yī)理(lǐ)解(jiě)语(yǔ)音(yīn)、环(huán)境(jìng)声(shēng)与(yǔ)音(yīn)乐(lè)的(de)跨(kuà)领(lǐng)域能(néng)力(lì),不(bù)仅(jǐn)能(néng)听(tīng)懂(dǒng)用(yòng)户(hù)周(zhōu)围(wéi)发(fā)生了什么事情,还能分析发现这些事情的隐藏含义,提高用户场景理解的泛化性

  基于 MiDashengLM 的模型通过自然语言和用户交互,为用户提更人性化的沟通和反馈,比如在用户练习唱歌或练习外语时提供发音反馈并制定针对性提升方案,又比如在用户驾驶车辆时实时对用户关于环境声音的提问做出解答。

  MiDashengLM 以 Xiaomi Dasheng 音频编码器为核心组件,是 Xiaomi Dasheng 系列模型的重要升级。在当前版本的基础上,小米已着手对该模型做计算效率的进一步升级,寻求终端设备上可离线部署,并完善基于用户自(zì)然语言提示的声音编辑等更全面的功能


发表评论