AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多模态学习
12 篇相关内容
相关话题
大语言模型
具身智能
医疗AI
机器人
自然语言处理
数据集
临床预测
电子健康记录
机器人操作
WAIC
Magic-VLA
触觉感知
大语言模型化身临床预测多面手,统一处理文本与结构化数据
研究人员提出将电子病历中所有模态的患者数据统一转化为自然语言序列,仅通过微调预训练大语言模型即可实现跨模态临床预测,无需为不同任务设计专门的融合架构。
a
arXiv
·
20 小时前
大语言模型
多模态学习
临床预测
电子健康记录
a
Magic-VLA K02攻克叠盒封胶长程任务,成功率突破90%
在WAIC现场展示中,Magic-VLA K02成功完成叠箱封胶任务,解锁物理AI新技能,长程操作成功率超过90%。
量
量子位
·
1 天前
具身智能
机器人操作
多模态学习
WAIC
量
UniTac模型:为视觉语言机器人赋予“触觉想象力”
研究人员提出UniTac模型,通过触觉信息增强视觉语言智能体,让机器人能够预测接触交互结果,入选ECCV 2026。
a
arXiv
·
2 天前
机器人
多模态学习
触觉感知
ECCV
a
UESF-Bench:首个统一化具身智能寻人跟随基准发布
研究者提出首个统一化具身智能寻人跟随基准UESF-Bench,解决现有基准将搜索与跟随任务割裂的问题,并推出SeekFollow-VLA框架实现任务自适应切换。
a
arXiv
·
4 天前
具身智能
人机交互
基准测试
多模态学习
a
SAGEAgent:让AI智能决策癌症诊断流程,减少55%检查负担
研究者提出基于大语言模型的临床智能体SAGEAgent,能根据患者情况动态选择必要的诊断检查项目,在保证生存预测准确性的同时,显著降低临床检查负担。
a
arXiv
·
7 天前
医疗AI
多模态学习
大语言模型
临床决策
a
语音-大模型融合新思路:交错式联合训练提升语音识别性能
研究者提出JSTIP方法,通过在语音-文本对齐对中构建交错序列,有效利用大语言模型的文本先验知识,显著提升自动语音识别的实体识别准确率。
a
arXiv
·
17 天前
语音识别
大语言模型
预训练方法
多模态学习
a
TAG-DLM:用扩散语言模型统一文本与图结构学习
研究者提出TAG-DLM方法,将文本推理与图消息传递统一在扩散语言模型中,通过拓扑注意力掩码实现图结构注入,仅需修改提示即可适应节点分类、链接预测等多种任务。
a
arXiv
·
19 天前
扩散语言模型
文本属性图
多模态学习
图神经网络
a
学术论文多模态数据集问世,助力关键词提取研究突破
研究团队构建了包含文本、图像和音频的学术论文多模态数据集,实验表明融合多模态信息能有效提升关键词提取性能。
a
arXiv
·
19 天前
多模态学习
关键词提取
学术论文
数据集
a
跨维智能瞄准物理AGI,百亿估值被视为新起点
跨维智能宣布将专注于物理人工智能(AGI)的研发,公司认为当前的百亿估值仅是长远发展的开端。
跨
跨维智能
·
20 天前
AGI
跨维智能
物理人工智能
机器人
跨
仿生记忆系统革新视觉语言模型测试时自适应
受大脑互补记忆系统启发,研究人员提出ComMem框架,通过模拟海马体与新皮质的协作机制,显著提升视觉语言模型在动态环境中的自适应能力。
a
arXiv
·
20 天前
视觉语言模型
测试时自适应
记忆系统
多模态学习
a
手语数据集规模化:全面盘点资源、基准与标注标准
本研究系统梳理了全球35种手语的120个数据集,分析了模态失衡、标注粒度等关键挑战,并发布了标准化文档工具与公开代码库,为构建包容、鲁棒的手语技术提供统一基础。
a
arXiv
·
31 天前
手语技术
数据集
人工智能伦理
多模态学习
a
ITNet:统一卷积、注意力和循环的通用可学习积分变换网络
研究人员提出了一种名为ITNet的统一神经网络架构,通过可学习的积分变换核,将卷积、自注意力和循环网络等主流模型整合为同一数学框架下的特例,并在多项任务中展现出优异性能。
a
arXiv
·
31 天前
神经网络架构
深度学习统一框架
可学习积分变换
多模态学习
a