AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
数据集
7 篇相关内容
相关话题
多模态学习
机器人学习
开源工具
Hugging Face
操作记录
语音大模型
多语言适配
新加坡
LoRA微调
内容安全
多模态AI
社交媒体
Hugging Face推出Grabette:开源机器人操作数据记录系统
Hugging Face发布开源系统Grabette,旨在标准化记录机器人操作数据,为机器人学习研究提供高质量数据集。
H
Hugging Face
·
32 分钟前
机器人学习
开源工具
数据集
Hugging Face
H
新加坡团队成功适配语音大模型,多语言任务表现优异
研究人员针对新加坡国情,将开源语音大模型适配至当地警务等敏感领域,在四种官方语言任务中表现超越更大规模模型,同时构建了超过50万样本的多语言问答数据集。
a
arXiv
·
7 天前
语音大模型
多语言适配
新加坡
LoRA微调
a
多图组合暗藏风险:当无害图片叠加产生有害语义
研究者发现社交媒体中多图组合可能产生隐性毒性,并提出新数据集与检测模型MiShield,有效识别单图无害但组合有害的内容。
a
arXiv
·
19 天前
内容安全
多模态AI
社交媒体
数据集
a
SEFORA论文发布:首个真实课堂写作反馈数据集与LLM评估框架
研究者发布SEFORA数据集,包含564份学生论文草稿和8240条教师批注,并推出UniMatch评估框架,揭示当前大模型在生成写作反馈时与教师实际批注存在显著差距。
a
arXiv
·
19 天前
教育AI
大语言模型
数据集
评估框架
a
学术论文多模态数据集问世,助力关键词提取研究突破
研究团队构建了包含文本、图像和音频的学术论文多模态数据集,实验表明融合多模态信息能有效提升关键词提取性能。
a
arXiv
·
20 天前
多模态学习
关键词提取
学术论文
数据集
a
首次揭秘!大模型预训练数据中的叙事结构分布规律
研究者首次对3万亿token开源预训练语料库Dolma进行叙事特征分析,发现网络文本中存在连续的多维叙事结构,且叙事质量在不同数据源和主题间分布不均。
a
arXiv
·
31 天前
大模型
预训练数据
叙事分析
自然语言处理
a
手语数据集规模化:全面盘点资源、基准与标注标准
本研究系统梳理了全球35种手语的120个数据集,分析了模态失衡、标注粒度等关键挑战,并发布了标准化文档工具与公开代码库,为构建包容、鲁棒的手语技术提供统一基础。
a
arXiv
·
31 天前
手语技术
数据集
人工智能伦理
多模态学习
a