从论文直接生成演示视频
arxiv.org/abs/2510.05096
新加坡国立大学的一项研究:输入Paper + Image (演讲人照片) + Audio ,生成一段介绍视频。效果如图。
“学术报告视频已成为科研交流的重要媒介,但其制作过程仍然非常耗时耗力,一段仅 2 到 10 分钟的短视频往往需要数小时的幻灯片设计、录制和剪辑。与自然视频不同,报告视频的生成涉及独特的挑战:其输入源于科研论文,包含密集的多模态信息(文本、图表、表格),并且需要协调幻灯片、字幕、语音和演讲者等多个同步通道。
为应对这些挑战,我们推出了 Paper2Video,这是首个基准数据集,包含了 101 篇研究论文及其对应的、由作者亲自制作的报告视频、幻灯片和演讲者元数据。我们还设计了四种定制化的评估指标——Meta Similarity、PresentArena、PresentQuiz 和 IP Memory——用于衡量视频向观众传达论文信息的效果。
在此基础上,我们提出了 PaperTalker,这是首个用于学术报告视频生成的多智能体框架。该框架集成了幻灯片生成功能,并通过一种新颖的“基于有效树搜索的视觉选择”方法进行布局优化,同时还包括光标定位、字幕生成、语音合成和虚拟人像渲染等功能,并通过并行化处理每页幻灯片来提升效率。
在 Paper2Video 数据集上的实验表明,我们方法生成的报告视频比现有的基线方法更忠实于原文、信息量更丰富,为实现自动化且即用型的学术视频生成迈出了坚实的一步。我们的数据集、智能体和代码均已通过此网址(https URL)开源。”
#AI创造营##AI生活指南##微博兴趣创作计划#
发布于 山东
