面向丰富曲调要素的影视配乐生成模型OA
多模态模型在生成语言、视频和乐曲等任务上表现出极大的潜力,然而在面向丰富曲调要素的背景音乐生成任务上仍面临着情感一致性和专业引导等问题。本文提出多维交互引导和时间比例编码,在音乐表达复合词中嵌入情感标签、韵律密度和韵律强度,生成具有多维交互特性的音乐向量表示。设计具备视频与音乐的节奏和谐对应的影视配乐生成模型,并给出相应的非配对数据驱动的模型网络训练方法。提出的“创作者-观众”双视角评估策略,可以更全面地评估模型的交互性和配乐效果。实验结果表明,该模型在客观评价指标上提高20.6%,推断效率由0.125提升至14.370,并且在主观评价指标上也有明显优势。
赵冰爽;罗铁坚;王承杰
中国科学院大学计算机科学与技术学院,北京101408中国科学院大学计算机科学与技术学院,北京101408中国科学院大学计算机科学与技术学院,北京101408
信息技术与安全科学
深度神经网络情感一致性影视配乐生成模型多维交互引导
《中国科学院大学学报(中英文)》 2026 (4)
P.566-575,10
中国科学院战略先导项目(E0421104)资助。
评论