AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
计算机视觉
18 篇相关内容
相关话题
Google DeepMind
多模态模型
OCR
生成式AI
图像处理
具身智能
3D感知
机器人
光鉴科技
视觉地点识别
对话式AI
跨模态检索
光鉴科技推出具身智能视觉感知方案,为物理AI打造“慧眼”
光鉴科技发布面向具身智能的视觉感知解决方案,旨在为物理世界中的AI系统提供基础的视觉感知能力。
光
光鉴科技
·
1 天前
具身智能
计算机视觉
3D感知
机器人
光
对话式视觉地点识别:让AI像人类一样通过对话定位场景
研究者提出对话式视觉地点识别新范式,将静态检索转变为交互式对话推理过程,并发布首个大规模对话基准数据集DlgQuest-Cities。
a
arXiv
·
4 天前
视觉地点识别
对话式AI
跨模态检索
人机交互
a
地理空间基础模型崛起:从预训练迈向智能体推理新范式
研究提出地理空间基础模型概念,通过大规模数据预训练实现AI分析范式革新,并展望了由大语言模型驱动的智能体地理推理未来。
a
arXiv
·
6 天前
基础模型
地理空间AI
计算机视觉
大语言模型
a
多图组合暗藏风险:当无害图片叠加产生有害语义
研究者发现社交媒体中多图组合可能产生隐性毒性,并提出新数据集与检测模型MiShield,有效识别单图无害但组合有害的内容。
a
arXiv
·
19 天前
内容安全
多模态AI
社交媒体
数据集
a
Omniverse 赋能视觉AI:合成数据与微调提升智能体精准度
NVIDIA 介绍三种基于 Omniverse 平台的合成数据生成与模型微调工作流,旨在提升视觉AI智能体在工业场景中的识别准确性与适应性。
N
NVIDIA AI
·
20 天前
合成数据
计算机视觉
NVIDIA Omniverse
AI智能体
N
无需训练即可定位概念?MLLM零样本概念命名能力评估
研究评估了多模态大语言模型在零样本条件下,为图像区域进行物体及部件级概念命名的能力,提出了一种可复现的评估框架,在物体级别准确率可达62%-88%。
a
arXiv
·
21 天前
可解释AI
多模态大模型
零样本学习
概念标注
a
COMPASS框架:统一多模态模型实现构图意图感知与生成控制
研究者提出COMPASS框架,首次在统一多模态系统中实现构图意图的感知与可控生成,通过共享专家令牌连接分析与生成任务。
a
arXiv
·
21 天前
多模态模型
可控生成
构图理解
人工智能框架
a
百度开源新OCR模型,长文档识别能力获显著提升
百度开源新一代OCR模型,宣称可一次性处理整本书籍级别的长文档,大幅提升复杂场景下的文字识别准确率与效率。
百
百度
·
23 天前
OCR
百度
开源
文档识别
百
谷歌DeepMind推出AI图像重构技术:角度决定一切
谷歌DeepMind发布基于生成式AI的图像重构技术,能够智能调整照片构图角度,提升视觉表现力。
G
Google DeepMind
·
26 天前
生成式AI
图像处理
计算机视觉
谷歌
G
智能手机摄像头实现无感心脏健康监测,DeepMind探索被动式健康管理新路径
Google DeepMind研究团队正在探索通过智能手机摄像头实现被动式心脏健康监测的技术方案,旨在为用户提供便捷、持续的健康数据追踪。
G
Google DeepMind
·
26 天前
健康监测
计算机视觉
智能手机应用
医疗AI
G
DeepMind推出Earth AI:从像素到规划,赋能自然生态恢复
Google DeepMind发布Earth AI项目,旨在利用人工智能技术,从卫星图像像素分析入手,为大规模自然生态恢复提供科学的规划与决策支持。
G
Google DeepMind
·
26 天前
AI for Earth
计算机视觉
可持续发展
Google DeepMind
G
Meta发布全新动画数据集,助力业余绘画作品动起来
Meta AI推出专为业余绘画设计的独特动画数据集,旨在降低动画创作门槛,让普通用户的画作也能轻松实现动态效果。
M
Meta AI
·
27 天前
AI数据集
动画生成
Meta AI
创意AI
M
AI视角重构:你的照片,重新构图
Google DeepMind发布生成式AI新进展,可智能分析并重新构图用户照片,探索图像创作的更多可能性。
G
Google DeepMind
·
27 天前
生成式AI
图像处理
Google DeepMind
计算机视觉
G
DeepMind探索AI新应用:辅助理解皮肤状况,赋能健康与生物科学
Google DeepMind公布最新研究方向,探索如何利用人工智能技术帮助用户理解和评估皮肤状况,旨在将AI能力拓展至健康与生物科学领域。
G
Google DeepMind
·
27 天前
快讯
Google DeepMind
AI医疗
健康科技
计算机视觉
G
DeepMind推出Earth AI:从像素到规划,用AI助力自然生态修复
Google DeepMind发布Earth AI项目,旨在利用人工智能技术分析卫星图像,为自然生态恢复提供数据驱动的规划方案。
G
Google DeepMind
·
27 天前
AI环境应用
Google DeepMind
计算机视觉
可持续性
G
Mistral AI 推出新一代 OCR 识别模型 Mistral OCR 3
Mistral AI 正式发布 Mistral OCR 3,该模型在文档图像的文字识别准确率与多语言支持方面均有显著提升。
M
Mistral AI
·
28 天前
Mistral AI
OCR
多模态模型
文档理解
M
清华开源空间模型亮相ECCV 2026,在动态环境中展现持续学习能力
清华大学团队开源的空间智能模型入选ECCV 2026,该模型在动态环境理解任务中表现优异,展现出持续学习的世界交互能力。
清
清华大学
·
29 天前
空间智能
持续学习
计算机视觉
开源模型
清
何恺明团队新突破:仅258M参数实现高质量文生图,核心成员多为本科生
何恺明团队在arXiv发布最新研究成果,仅用258M参数模型即可实现高质量文本生成图像,团队六位作者中有五位为在读本科生。
a
arXiv
·
31 天前
文生图
轻量化模型
何恺明
计算机视觉
a