听力快讯丨AI革新:精准识别手语手势的智能模型
NEWS
“
佛罗里达大西洋大学的研究人员利用MediaPipe和YOLOv8开发了一个突破性的AI系统,该系统在识别美国手语(ASL)手势时,准确率高达98%。
要点


-
高准确度:这个AI模型在识别ASL手势时,准确率、召回率均达到了98%,F1分数更是高达99%,显示出其精确度和可靠性都很高。
-
创新方法:研究人员将MediaPipe(用于手部追踪)与YOLOv8(用于物体检测)相结合,使系统能够高效识别手部姿势的细微变化。
-
实际应用潜力:未来的研究将侧重于扩大手势数据集,并优化系统在边缘设备上的性能,从而让这个系统能够在教育、医疗和日常交流等实时、包容性应用场景中发挥实际作用。
手语是一种复杂而关键的交流方式,对于聋哑人士而言至关重要,它依靠手势、面部表情和肢体语言来精确传达信息。美国手语充分展现了这种语言的复杂性,它拥有独特的语法规则和句法结构。
值得注意的是,手语并非全球统一,世界各地使用的手语各有特色,每种手语都拥有自己独特的语法、句法和词汇,这凸显了全球手语的多样性和复杂性。

01
利用技术理解手语
人们正积极探索各种方法将手语手势实时转换为文字或口语。为了改善聋哑人士的沟通环境,我们需要一个可靠且实时的系统,能够准确检测和跟踪美国手语手势。这样的系统在消除沟通障碍、促进更包容的交流互动方面将发挥重要作用。
佛罗里达大西洋大学工程与计算机科学学院的研究人员开展了一项开创性研究,专注于利用计算机视觉技术识别美国手语字母手势。他们构建了一个包含29,820张美国手语手势静态图像的定制数据集,并借助MediaPipe技术为每张图像标注了21个手部关键特征点,这些特征点提供了手部结构和位置的详细空间信息。
02
融入深度学习(AI)解决方案
这些标注在提升YOLOv8(研究人员训练的深度学习模型)的精确度方面发挥了至关重要的作用,使模型能够更准确地检测出手势的细微差异。
该研究成果发表在《Franklin Open》杂志上。结果显示,通过利用这些详细的手部姿态信息,模型实现了更精细的检测过程,能够准确捕捉美国手语手势的复杂结构。将MediaPipe(用于手部运动追踪)与YOLOv8(用于训练)相结合,形成了一个高精度识别美国手语字母手势的强大系统。
“将MediaPipe和YOLOv8相结合,并对超参数进行微调以获得最佳精度,这是一种开创性和创新性的方法。”该研究的第一作者、佛罗里达大西洋大学(FAU)电气工程与计算机科学系的博士生Bader Alsharif表示,“这种方法在以往的研究中尚未被探索过,因此它为未来的进步提供了一个新的、有前景的方向。”
研究结果显示,该模型的准确率高达98%,正确识别手势的能力(召回率)为98%,整体性能得分(F1分数)为99%。同时,它的平均精度均值(mAP)达到了98%,更详细的mAP50-95得分为93%,这充分展示了其在识别美国手语手势方面的强大可靠性和精确度。
“我们的研究结果证明了模型能够以极低的错误率准确检测和分类美国手语手势。” Alsharif说,“重要的是,这项研究的结果不仅强调了系统的稳健性,还强调了其在实际实时应用中的潜力,以实现更直观的人机交互。”
03
提升对手部姿态与手势的理解
MediaPipe中的关键点标注成功融入YOLOv8训练过程,显著提升了边界框的准确性和手势分类效果,使模型能够捕捉到手部姿态的细微变化。这种将关键点追踪与物体检测相结合的两步策略,对于确保系统在实际场景中的高精度和高效能至关重要。该模型即使在手部位置和手势多变的情况下也能保持高识别率,这凸显了其在多种操作环境中的强大实力和适应能力。
“我们的研究展示了将先进物体检测算法与关键点追踪相结合用于实时手势识别的潜力,为美国手语翻译提供了一种可靠的解决方案。”佛罗里达大西洋大学(FAU)电气工程与计算机科学系的教授、该研究合著者及博士Mohammad Ilyas表示,“该模型的成功在很大程度上得益于迁移学习的精心整合、数据集的细致创建以及超参数的精确调整。这一组合促成了一个高精度且可靠的美国手语手势识别系统的开发,标志着辅助技术领域的一大进步。”
今后的工作将侧重于扩展数据集,纳入更多种类的手型和手势,以提升模型区分视觉上可能相似手势的能力,从而进一步提高识别准确性。此外,优化模型以便在边缘设备上部署也将成为优先事项,以确保其在资源受限的环境中仍能保持实时性能。
“通过提升美国手语的识别能力,这项工作有助于创建能够促进聋哑人和听力障碍人士沟通的工具。”佛罗里达大西洋大学(FAU)工程与计算机科学学院院长Stella Batalama表示,“该模型能够可靠地解读手势,这为支持无障碍的包容性解决方案打开了大门,让依赖手语的人在教育、医疗或社交等各种日常互动中能够更加顺畅和有效地交流。这一进展为实现一个减少沟通障碍、更加包容的社会带来了巨大希望。”
(图源网络,侵删)
原文链接:https://hearingreview.com/inside-hearing/research/ai-model-highly-accurate-in-recognizing-sign-language-gestures



