北京商报讯(记者 魏蔚)7月17日-7月20日,2026 世界人工智能大会暨人工智能全球治理高级别会议在上海举行。在上海世博展览馆H1展区,一座“声音巴别塔”位于模思智能展台中央。参观者可以说出不同国家的语言或不同地区的方言,系统识别其中的语言、口音和表达特征后,会点亮塔上的一个个节点。
模思智能联合创始人、CEO李世民向北京商报记者解释,这是模思智能用直观的方式展示,AI对语言、口音和表达习惯的差异化理解。支撑这一装置的,是 MOSS-Transcribe 与 MOSS-Audio 对复杂声音的识别和理解能力。模型不仅要听清说了什么,也要尽可能理解语气、情绪、节奏和上下文。在跨语言沟通、全球客服等场景中,这些非文字信息往往会直接影响意图判断。
7月,模思智能与 OpenMOSS 团队连续发布多项模型和产品,先开源多说话人长音频转写模型 MOSS-Transcribe-Diarize-0.9B,后开放一站式 AIGC 创作平台 Mossland 与模思开放平台 MOSS API 公测,再开源实时视觉理解模型 MOSS-VL-Realtime。
在李世民看来,当模型进入真实世界,关键不只是识别声音和画面,而是理解这些信息在什么情境中发生,并据此判断何时回应、如何回应。这正是模思智能对“情境智能”的回答。
本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871
商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)
![]()
网上有害信息举报 违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn
ICP备案编号:京ICP备08003726号-1
京公网安备11010502045556号 互联网新闻信息服务许可证11120220001号