Research Article

开发用于智能音乐教育平台个性化体感和节奏评估的交互式人工智能工具

DOI:

10.3791/69058

December 19th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种可重复的体感音乐学习方案,结合了残余LSTM识别与TRPO以适应适应困难度。它涵盖了预处理、FFT功能、培训、个性化和评估。在公开数据集上,混合模型通过三个主体不相交折叠达到了Acc 95.0 / P 93.5 / R 94.6 / F1 94.2。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

传统音乐教育通常缺乏互动性和实时适应性,尤其是在远程环境中。本研究引入了针对音乐教育平台的个性化体感框架TRPO-ResLSTM。该系统捕捉运动、节奏和响应时间,利用维纳滤波和Z分数归一化预处理数据, 并通过FFT 提取特征。手势识别由DeepRes-LSTM执行,适应性难度则由TRPO强化学习调节。增量学习确保了各会谈的个性化。在一个公开可得的匿名手势-节奏数据集(n = 2,730个样本;训练/验证/测试分配70/15/15)上的实验显示,其表现优于多模态基线,实现95%准确率、93.5%准确率、94.6%回忆率和94.2%的F1评分。消融研究证实了TRPO和Res-LSTM的单独贡献。该协议的创新在于将强化学习与残余时间建模整合,实现自适应手势识别,实现稳定且个性化的学习。这项工作表明,自适应、响应手势的工具能够提升智能音乐教育中的参与度、个性化和技能的进步发展。局限性包括依赖单一数据集以及需要真实学习者验证,这为未来工作指明方向。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工智能(AI)和躯体感官技术的最新进展正在重塑音乐教育,使学习者能够通过身体动作与音乐互动,将手势转化为音符、节奏或虚拟乐器的控制 1,2。这些互动功能相比传统课堂教学提升了参与度、记忆力和创造力,体感工具则使学生能够通过身体打击乐、手势进行和合奏模拟来练习节奏、协调和表达能力。3.结合AI驱动的自适应路径,学习者将获得个性化内容、实时反馈和逐步技能发展,提升动力和成果 4,5

尽管有这些发展,现有平台往往依赖有限的学习方式,缺乏个性化的连续性,或未能适应多样化的文化和体育学习风格 6,7。传统方法在提供实时、数据驱动的调整方面也不足,无法反映学习者不断演变的能力。例如,动作捕捉和可穿戴设备可以生成丰富的数据集,但在自适应教学8,9中常被低估。此外,尽管音乐库和学习管理系统扩展了可及性,但它们很少能在会话间提供动态个性化,这在多元文化和异质学习环境中尤为关键。10

为弥补这些空白,本研究提出了一种新的信任区域政策优化深残留长短期记忆(TRPO-ResLSTM)框架,应用于音乐教育平台11。该系统集成了先进的预处理方法,包括维纳滤波和Z分数归一化,并结合快速傅里叶变换以提取频域特征。Res-LSTM提供了对手势和时间序列的稳健识别,而TRPO强化学习则根据学习者的表现动态调整任务难度。增量学习通过跨会话更新模型进一步强化个性化。

在Kaggle音乐、手势和节奏数据集上进行了实验,共2730个样本,分为训练、验证和测试三个子集。结果显示,所提方法持续优于基础多模态架构,准确率、精度、召回率和F1值均在93%-95%之间。消融分析确认TRPO和Res-LSTM组分的有效性。通过实时提升节奏准确性、用户参与度和策略稳定性,该框架为在资源有限和远程学习环境中提升音乐教育效率提供了切实可行的解决方案。关于人工智能驱动音乐教育的相关研究强调了体感参与、适应性学习个性化,甚至在音乐治疗和自动作曲中的应用潜力12,13。本研究基于这些发现,提供了一套可重复的方案,将强化学习与深度时间建模相结合,推动智能音乐教育领域的发展。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究分析了匿名公开数据,未涉及人体受试者或动物。因此,无需额外的伦理审批。

1. 概述

该协议描述了一个基于深度残差LSTM识别和信任区域策略优化(TRPO)用于自适应难度控制的可重复体感音乐教育框架。它包括数据集准备、预处理、频域特征提取、模型架构、训练、个性化和评估。 图1 展示了端到端工作流程14

2. 数据集

使用了一个公开的匿名音乐手势和节奏数据集,记录身体对听觉线索(如节奏和节拍强度)的反应。该数据集提供了适合研究节律执行和学习行为的多模态时间序列数据。每条记录包含动作模式、时间和节奏准确度测量、响应反馈以及任务完成时间。由于该数据集完全匿名且对公众开放,无需额外的机构审查委员会批准。对于实验,数据按受试者划分为训练、验证和测试子集,以避免身份泄漏;详细统计数据和分配比率见 表1。采用了三种主体不相交折叠,所有运行中固定的随机种子,以及所有模型变体的相同预处理以确保可比性16

数据集呈现出均衡的节奏手势分布,训练、验证和测试划分在时间和动作特征上表现出相似的变异性。速度偏差和运动振幅的描述性统计(中位数±IQR)在各分割间可比较,表明协变量偏移最小。

3. 数据预处理

  1. Z分数归一化
    原始数据采用Z分数归一化标准化。对于通道c和时间t:
    figure-protocol-1(1)
    我们只在训练集上计算了μcσc,并将其应用于验证和测试集,以避免泄漏17
    归一化后,所有频道均值和单位方差接近零,确保参与者间的可比性。批次诊断确认折叠间没有漂移。
  2. 维也纳滤波
    为抑制噪声,我们在频域应用了维纳滤波器:
    figure-protocol-2(2)
    其中Y(k)是观测到的频谱,\hat{X}(k)是去噪估计值, Sxxk)、 Snnk)表示信号/噪声功率谱密度。我们使用与下游FFT一致的窗口长度和重叠来维持相位相干18
    维纳滤波在保留主导节奏成分的同时,高频噪声减少了~30%。信噪比在未削弱拍锁峰值的情况下有所提升。
  3. 特征提取(FFT)
    短时间FFT功能用于重叠窗口:
    figure-protocol-3(3)
    提取的描述符包括主导频率、频谱通量和能带-能量比值。还计算了速度锁定峰值突出度和峰值间变异,以捕捉微时序稳定性19
    FFT显示了与音乐节奏(2-3赫兹)对齐的清晰频谱峰值,证实了数据集中的节奏结构。在正确执行的试验中,峰值噪声比平均超过6-8 dB。

4. 型号:TRPO-ResLSTM

  1. 残余LSTM(ResLSTM)
    时间模式通过叠加LSTM和残留捷径建模:
    figure-protocol-4 (4)
    其中P是单位元或匹配维度的投影。残余连接减少梯度消失,使时间堆栈更深,同时保持训练稳定性20
    残差连接相比普通LSTM提高了梯度流动和分类精度。消融结果显示,在相当参数计数下,非残差堆叠检测的准确率为+0.7-1.1 pp。
  2. 信任区域策略优化(TRPO)
    TRPO动态控制任务难度。个性化奖励是:
    figure-protocol-5(5)
    成功得分s t,速度偏差 Δtempot,手势不相似度 dt(如 DTW 距离或分类丢失),以及切换指示器 ut(惩罚频繁难度变化)。我们用KL约束优化了一个信任区域目标:
    figure-protocol-6(6)
    1. 强化学习的设置与符号
      适应难度被表述为有限视野MDP,其中状态st汇集了窗性体感特征(加速度计通道、手关节位置、归一化后的节奏描述符、维纳滤波和FFT),动作a为控制节奏容忍和手势严格性的离散难度等级。奖励rt平衡任务成功率、时间偏差和投入度,且对切换困难过高的行为有小额惩罚,以抑制振荡。策略更新遵循TRPO,保守步时采用KL发散约束。在方程中,(5-6),g(y,x) 表示任务特定的损失梯度,Wζ) 是参数 ζ 上的 L2 正则化子,πθ 是参数为 θ 的随机策略,DKL 定义信任区域,γ 是贴现因子,δ 是信任区域半径。超参数α,β,γ,δ通过网格搜索选取验证分割区间(表2区间),以平衡稳定性和响应性;当吉隆坡平均达到0.921时,提前停车。
    2. 理由与替代方案
      TRPO受KL约束的onpolicy更新更受青睐于小型会话级批次和非平稳学习者行为;PPO/SAC依然充满希望,并将在未来22项工作中作为基准测试。
      TRPO实现了比基线控制器更稳定的学习和更平滑的难度调整,并实现了一致的收敛。学习曲线显示TRPO-ResLSTM的单调改善和基层基序稳定较单成分基线更早。
  3. 个性化与会话更新
    每次用户会话后,增量更新对ResLSTM和TRPO模型进行了细化,学习率和排练缓冲区较小。我们使用了每位学习者近期试验的少量彩排缓冲,以防止偏移,并将每次会话的更新限制在固定预算内以保持稳定性。个性化效果以学习者在固定视野内首次与最后一次会话之间F1的相对增益来衡量23
    会话间个性化提高了用户特定准确率2%-3%,且避免了灾难性的遗忘。中级基线准确率的学习者获得最大收益,表明有足够的余裕支持自适应支架。
  4. 算法与实现
    完整的伪代码(“算法1:TRPO-ResLSTM”)和参考的Python 3.10.1实现如下。所有图表均包含测量定义、误差条和样本量。我们报告三次受试者-不相交折叠的均值±标准差,并根据需要使用重复测量方差分析或弗里德曼检验评估模型间差异,并进行多重度调整后的事后比较(α = 0.05)。为确保可重复性,我们在材料表中列出了软件包版本和GPU/CPU规格,并附上了带有环境和种子配置的README24
    该协议持续重现多模态基线的改进,验证了其可重复性。跨种子独立重跑得出集成模型精度<0.5pp。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

实验装置
TRPO-ResLSTM 框架在 Python 3.10.1 中实现,采用 GPU 加速。计算环境、运动感应硬件和Python库均列于材料表中。数据被按主体-不相连的训练/验证/测试分区,如 表1 (70/15/15)所示。关键超参数总结于 表2。评估了三种模型:基线TRPO、基线ResLSTM和集成TRPO-ResLSTM。这一设置使音乐学习场景中能够持续评估手势识别、自适应难度控制和个性化。

混淆矩阵
分类表现首先通过对未被保留测试集的混淆矩阵进行检验(见图2)。行表示真实标签,列表示预测;数值是行归一化的。强烈的对角线优势表明在动作类别间有扎实的识别,只有紧密相关的节奏模式之间存在轻微混淆。

特征重要性分析...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种混合协议TRPO-ResLSTM,整合强化学习和残余时间建模,用于基于手势的音乐教育。通过结合信任区域策略优化(TRPO)的稳定性与残余LSTMs的序列学习能力,该框架实现了实时手势识别和自适应难度控制,实现个性化反馈和渐进式技能习得。为确保可重复性,采用了受试者-不相交折叠、固定种子和跨模型相同的预处理,平均±标准差报告了三次折叠,显著性检验与结果部分保持一致。

这项工作的贡献在于推动个性化和互动学习环境的发展。与依赖静态教学或单模态识别的系统不同,TRPO-ResLSTM动态适应学习者的节奏和动作模式,支持以实践为导向的第26期课程中的参与度和记忆。我们报告的教育导向指标(节律同步、自适应响应、个性化效果、记忆保持)将以学习者为中心的成果作化,而不仅仅是机器学习指标,并且与真实学习环境中多模态分析的最新呼声相呼应27

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在利益冲突。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢同事们对研究设计和稿件准备的建设性反馈。该工作未获得任何公共、商业或非营利部门资助机构的具体资助。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
加速度计传感器数据卡格尔(公有领域)数据集中包含的多模态输入信号(运动模式、时序特征)
GPU工作站英伟达公司,美国训练硬件:NVIDIA RTX 3080(10 GB),32 GB 内存,Ubuntu 20.04
手部 - 关节位置数据卡格尔(公有领域)体感输入用于手势识别
Matplotlib(v3.7)https://matplotlib.org用于绘制数据和性能指标的可视化库
NumPy(v1.23)https://numpy.org数组作数值计算库
公共音乐手势与节奏数据集卡格尔(公有领域)匿名数据集,包含2730个样本,记录身体对节奏和拍子的反应;用于培训/验证/测试(70/15/15)
Python 3.10.1Python 软件基金会,https://www.python.org模型实现与分析的编程环境
PyTorch(v1.13)https://pytorch.org用于实现ResLSTM和TRPO模块的深度学习框架
SCIKIT - 学习(v1.2)https://scikit-learn.org用于预处理和评估的机器学习工具
科学(v1.10)https://scipy.org科学计算库(用于维纳过滤)

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wei, J., Karuppiah, M., Prathik, A. College music education and teaching based on AI techniques. Comput Electr Eng. 100, 107851(2022).
  2. Yu, X., et al. Developments and applications of artificial intelligence in music education. Technol. 11 (2), 42(2023).
  3. Fang, J. Artificial intelligence robots based on machine learning and visual algorithms for interactive experience assistance in music classrooms. Entertain Comput. 52, 100779(2025).
  4. Zhang, S., Lu, X., Liu, X. Study on the influence of AI composition software on students' creative ability in music education. J Educ Technol Innov. 6 (2), (2024).
  5. Feng, Y. Design and research of music teaching system based on virtual reality system in the context of education informatization. PLoS One. 18 (10), e0285331(2023).
  6. Zhou, X. Entertainment performance robots application in music network classrooms based on speech sensor recognition and artificial intelligence. Entertain Comput. 52, 100782(2025).
  7. Yu, H., Zou, Z. The music education and teaching innovation using blockchain technology supported by artificial intelligence. Int J Grid Util Comput. 14 (2-3), 278-296 (2023).
  8. Hong Yun, Z., et al. A decision-support system for assessing the function of machine learning and artificial intelligence in music education for network games. Soft Comput. 26 (20), 11063-11075 (2022).
  9. Dey, M. T., Patra, S., Mitra, S. Enhancing music education with innovative tools and techniques: The role of artificial intelligence in musical works. Enhancing Music Education With Innovative Tools and Techniques. , IGI Global. 19-50 (2025).
  10. Lin, X., et al. The application of music therapy in the rehabilitation education of children with cerebral palsy. J Investig Med. 73 (1 Suppl. 1), (2025).
  11. Wang, X. Design of vocal music teaching system platform for music majors based on artificial intelligence. Wirel Commun Mob Comput. 2022 (1), 5503834(2022).
  12. Chen, Y., Sun, Y. The usage of artificial intelligence technology in music education system under deep learning. IEEE Access. , 130546-130556 (2024).
  13. Yang, Y., et al. Multi-source and heterogeneous online music education mechanism: An artificial intelligence-driven approach. Fractals. 31 (6), 2340154(2023).
  14. Sang, J. The intersection of technology and art: A study on AI-driven CTCL music teaching paradigm. , (2024).
  15. Yin, Y. Research on technological innovation and application of music education transformation under the background of technology. J Educ Theory Pract. 2 (2), (2025).
  16. Yuan, Y. Influencing factors and modeling methods of vocal music teaching quality supported by artificial intelligence technology. Int J Web Based Learn Teach Technol. 19 (1), 1-16 (2024).
  17. Sanganeria, M., Gala, R. Tuning music education: AI-powered personalization in learning music. arXiv Prepr. , (2024).
  18. Qiusi, M. Research on the improvement method of music education level under the background of AI technology. Mob Inf Syst. 2022 (1), 7616619(2022).
  19. Xu, Z. Construction of an intelligent recognition and learning education platform of national music genre under deep learning. Front Psychol. 13, 843427(2022).
  20. Wang, X., et al. College music teaching and ideological and political education integration mode based on deep learning. J Intell Syst. 31 (1), 466-476 (2022).
  21. Tang, H., Zhang, Y., Zhang, Q. The use of deep learning-based intelligent music signal identification and generation technology in national music teaching. Front Psychol. 13, 762402(2022).
  22. Artificial intelligence in music education: Exploring applications, benefits, and challenges. Yue, Y., Jing, Y. Proc Int Conf Educ Inf Technol, , 141-146 (2025).
  23. Bai, A., Yeh, C. K., Hsieh, C. J., Taly, A. An efficient rehearsal scheme for catastrophic forgetting mitigation during multi-stage fine-tuning. arXiv Prepr. , (2024).
  24. Ravi, N., Goel, A., Davis, J. C., Thiruvathukal, G. K. Improving the reproducibility of deep learning software: An initial investigation through a case study analysis. arXiv Prepr. , (2025).
  25. Chen, J., Jin, F., Jiao, Y., Zhan, Y., Qin, X. Improving dynamic gesture recognition with attention-enhanced LSTM and grounding SAM. Electronics. 14 (9), 1793(2025).
  26. Ouyang, F., Dai, X., Chen, S. Applying multimodal learning analytics to examine the immediate and delayed effects of instructor scaffoldings on small groups' collaborative programming. Int J STEM Educ. 9 (1), 45(2022).
  27. Aoyama Lawrence,, Weinberger, L., A, Being in-sync: A multimodal framework on the emotional and cognitive synchronization of collaborative learners. Front Educ. , (2022).
  28. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O. Proximal policy optimization algorithms. arXiv Prepr. , (2017).
  29. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. PMLR. Haarnoja, T., Zhou, A., Abbeel, P., Levine, S. Proc Int Conf Mach Learn, , (2018).
  30. Huang, S., Dossa, R. F. J., Raffin, A., Kanervisto, A., Wang, W. The 37 implementation details of proximal policy optimization. ICLR Blog Track. , https://iclr-blog-track.github.io/2022/03/25/ppo-implementation-details/ (2023).
  31. Sclater, N., Bailey, P. Code of practice for learning analytics. , https://www.jisc.ac.uk/guides/code-of-practice-for-learning-analytics (2022).
  32. Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proc IEEE. 77 (2), 257-286 (2002).
  33. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).
  34. Proverbio, A. M., Camporeale, E., Brusa, A. Multimodal recognition of emotions in music and facial expressions. Front Hum Neurosci. 14, 32(2025).
  35. Kang, S. Adaptations, code-switching, and novelty with cultural integrity: Musicians performing and learning musical instruments in different musical traditions. J Res Music Educ. , (2025).
  36. Han, Y., Han, L., Zeng, C., Zhao, W. The innovation path of VR technology integration into music classroom teaching in colleges and universities. Sci Rep. 15 (1), 12200(2025).
  37. Huang, A. Y., Lu, O. H., Yang, S. J. Effects of artificial intelligence-enabled personalized recommendations on learners' learning engagement, motivation, and outcomes in a flipped classroom. Comput Educ. 194, 104684(2023).
  38. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Intelligent Music EducationSomatosensory EvaluationGesture RecognitionRhythm EvaluationTRPO Reinforcement LearningResLSTM ModelAdaptive DifficultyIncremental LearningFeature ExtractionPersonalized Learning

Related Articles