AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
语音识别
14 篇相关内容
相关话题
自然语言处理
语音合成
多语言处理
Vapi AI
AI平台
医学教育
后处理
语义保真
语音助手
xAI
客服自动化
AI产品
AI_LectureNote:英语医学术语还原与语义保真度研究
研究人员开发了AI_LectureNote后处理工作流,可将韩英医学讲座的语音转写文本中的拉丁字母医学术语还原,但研究发现术语还原并不保证语义准确性,存在语义漂移现象。
a
arXiv
·
5 小时前
语音识别
医学教育
后处理
多语言处理
a
xAI发布Grok Voice Think Fast 1.0:专为真实场景打造的语音客服助手
xAI推出新一代语音客服助手Grok Voice Think Fast 1.0,该产品能在嘈杂环境中快速准确地处理复杂工作流程,提升客服效率。
x
xAI
·
2 天前
语音助手
xAI
客服自动化
AI产品
x
Vapi AI发布业界领先的TTS与STT API服务
Vapi AI近日推出号称业界最自然的文本转语音(TTS)和最具性价比的语音转文本(STT)API服务,为开发者提供高效语音处理解决方案。
x
xAI
·
2 天前
快讯
语音合成
语音识别
API服务
Vapi AI
x
语言相似性助力极低资源语音识别:Warlpiri 语言研究
本研究探讨了语言相似性如何提升极低资源场景下的跨语言语音识别性能,通过结合声学和语言学特征,为澳大利亚原住民语言 Warlpiri 筛选出最有效的源语言。
a
arXiv
·
7 天前
语音识别
低资源语言
迁移学习
语言相似性
a
词汇表移植技术:解决孟加拉语轻量语音识别中的自回归崩溃问题
研究提出一种创新的词汇表移植方法,通过替换解码器词汇表为原生孟加拉语词汇,显著降低轻量语音识别模型在非拉丁语系语言上的自回归崩溃风险。
a
arXiv
·
8 天前
语音识别
边缘计算
多语言处理
自然语言处理
a
语音-大模型融合新思路:交错式联合训练提升语音识别性能
研究者提出JSTIP方法,通过在语音-文本对齐对中构建交错序列,有效利用大语言模型的文本先验知识,显著提升自动语音识别的实体识别准确率。
a
arXiv
·
18 天前
语音识别
大语言模型
预训练方法
多模态学习
a
Mamba模型在南非多语言语音识别中的表现评估
研究团队评估了Mamba状态空间模型在七种南非语言语音识别任务中的表现,发现其在保持识别准确率的同时,比Conformer模型更节省计算资源且训练更快。
a
arXiv
·
18 天前
Mamba模型
语音识别
多语言AI
非洲语言
a
科大讯飞升级智能交互生态,三大平台同步更新
科大讯飞在智能交互生态发布会上宣布对三大平台进行升级,进一步优化AI交互体验。
科
科大讯飞
·
18 天前
科大讯飞
智能交互
AI平台
语音识别
科
ASR评测新思路:双重参考基准揭示非典型语音识别盲区
研究团队提出双重参考基准方法,揭示现有ASR系统在非典型语音(如口吃)评测中的局限性,发现不同转录标准会显著影响模型性能排名。
a
arXiv
·
20 天前
语音识别
ASR评测
非典型语音
人工智能伦理
a
G-SPIN:基于图神经网络的语音识别纠错框架,精准修正关键语义错误
研究者提出名为G-SPIN的ASR纠错框架,通过图神经网络构建语音相似候选词图,再结合上下文语言模型进行重排序,显著提升命名实体、否定词等关键语义词的识别准确率。
a
arXiv
·
26 天前
语音识别
图神经网络
自然语言处理
纠错系统
a
Vapi AI 推出自然语音合成与高性价比语音识别 API
Vapi AI 发布新一代语音合成与语音识别 API,号称提供最自然的 TTS 体验和最具成本效益的 STT 服务。
x
xAI
·
27 天前
快讯
语音合成
语音识别
Vapi AI
API
x
Deepgram语音识别与合成模型正式登陆Together AI平台
Deepgram的语音转文本和语音合成模型现已在Together AI专用模型推理服务中上线,为实时语音智能体提供生产级支持。
T
Together AI
·
27 天前
语音识别
语音合成
AI平台
模型部署
T
Mistral AI推出Voxtral:实时语音转录模型,号称“音速级”处理
Mistral AI发布全新语音转录模型Voxtral,宣称其处理速度可达“音速级别”,能够实现近乎实时的语音转文字功能。
M
Mistral AI
·
28 天前
快讯
语音识别
Mistral AI
实时转录
AI模型
M
Transformer模型在古兰经语音识别中的性能对比研究
研究团队系统评估了Wav2Vec2.0、HuBERT和XLS-R等预训练Transformer模型在古兰经语音识别任务中的表现,在超过870小时的专业与用户诵读数据上微调后,最佳配置将词错误率降至0.08。
a
arXiv
·
31 天前
语音识别
Transformer
古兰经
Wav2Vec2
a