苹果发布DiscoSign:把文本到手语gloss的翻译从单句扩展到语篇
苹果机器学习研究团队联合东北大学、加劳德特大学提出DiscoSign,用模块化LLM框架处理空间共指、问答小句和概念-gloss一致性,并配了一套新的语篇级评测指标。
AI解读:手语翻译系统过去基本只看单句,翻完一句就翻下一句,句子之间指代谁、动作发生在哪个位置,系统不管。DiscoSign想解决的就是这个问题:把翻译单位从句子抬到一段话,让同一个实体在整个语篇里保持同一空间位置,避免前后对不上。
它具体处理三件事:空间共指、问答小句结构,以及英文概念和ASL手语词之间映射的一致性。前两个是手语语法本身的东西,第三个更像是防止同一个词这次翻成A、下次翻成B。框架是模块化的,底层用LLM。
对做手语生成和无障碍工具的人来说,价值主要在评测。论文承认传统翻译指标抓不到语篇质量,所以另做了一套针对这三维度的指标。至于实际产品效果,来源没有给出用户测试或部署数据,只能确认在空间一致性和实体追踪上相对单句翻译有提升,单句翻译质量仍保持有竞争力。
参与的还有东北大学和加劳德特大学的研究者,后者本身就是聋人教育机构。论文自称是首个系统性的语篇级文本到手语gloss翻译框架,并附带对应评测方法。
苹果机器学习研究团队发布DiscoSign,一种面向语篇的文本到手语gloss翻译方法。论文作者包括Vasileios Baltatzis、Mert Inan、Connor Gillis、Raja Kushalnagar、Lorna Quandt、Leah Findlater和Colin Lea,其中标注了东北大学和加劳德特大学的参与,Mert Inan的工作是在苹果期间完成的。
论文指出,手语处理系统传统上只在句子层面运行,忽略了对手语理解至关重要的语篇现象。DiscoSign基于语言学研究,采用模块化的大语言模型翻译框架,针对三个现象:空间共指(实体在整个语篇中保持一致的空间位置)、问答小句(QACs,承担特定语篇功能的假分裂结构),以及概念-gloss一致性(保证英文概念与美国手语(ASL)手势之间的映射稳定)。
论文称传统翻译指标无法捕捉语篇层面的质量,因此提出了一套新的评测指标,用于评估框架所处理的每个语篇连贯维度。在句子级和语篇级数据集上的实验显示,相对于仅句子翻译,这套语篇感知处理显著改善了空间一致性和实体追踪,同时保持了有竞争力的单句gloss翻译质量。
论文称该工作建立了首个系统性的语篇级文本到手语gloss翻译框架及相应的评测方法。以上内容依据论文摘要。