#声音引力场#2025年8月25日的人工智能新闻播报:
- 苹果推出高效理解长视频的大语言模型SlowFast-LLaVA:据9to5mac报道,苹果研究团队开发出适配版SlowFast-LLaVA模型,在长视频分析理解任务上表现超越更大规模模型。该模型通过双流架构优化视频处理效率,其10亿、30亿和70亿参数版本在LongVideoBench等长视频基准测试中均创佳绩,且在图像理解任务方面表现出色。目前模型输入帧长限制为128帧,团队表示将探索内存优化技术提升性能。该模型基于公开数据集训练并开源。
- Meta公布Reels短视频音频翻译功能:据TechCrunch报道,Meta宣布向全球Facebook和Instagram用户推出AI语音翻译功能。此功能允许创作者将内容翻译成其他语言,AI翻译会模仿创作者的声音和语调,还可选择启用唇形同步功能。目前支持英语与西班牙语互译,未来将添加更多语言。Facebook粉丝超1000的创作者和所有Instagram公众账号可使用该功能。
- 钉钉发布智能硬件DingTalk A1:在钉钉十周年暨新品发布会上,钉钉推出了智能硬件产品DingTalk A1。这是一款超薄的AI录音设备,能够记录、转写、翻译、总结和分析语音沟通内容,并和钉钉App进行连接并打通工作流程。其免费版将为用户提供1000分钟免费语音转写时长及10GB云存储空间。
- NVIDIA推出Jetson AGX Thor开发者套件:据cnx-software报道,NVIDIA上周发布Jetson AGX Thor开发者套件,专为边缘AI与机器人应用设计。该套件配备Jetson T5000系统模块,AI性能达2070 TOPS(FP4),AI计算能力是Jetson AGX Orin的7.5倍以上,能效提升3.5倍。套件现可从指定渠道预订,起售价3499美元,预计2025年11月20日上市。 #2025微博音频创享日# http://t.cn/AXvS2Yh6
发布于 福建
