跳到正文

#多模态

今日 0 条
9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,从缩小搜索空间到选出候选化合物仅用一个周末,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,读者可了解 AI 参与药物发现的具体流程与验证结果。

9月25日周五
9月24日周四
9月3日周四
8月28日周五
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展与首尾帧插值等视频控制能力

    Google DeepMind 宣布推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 面向开发者开放,使 Omni 1.1 达到可用于专业生产的状态。

    推荐理由:原文列出了场景延展、首尾帧插值、360p 快速原型和 4K 升档等具体能力与参数,可据此评估其对生成视频工作流的改动。

8月27日周四
8月21日周五
  1. Google Research45

    Google Research:ME-POIs 如何用移动性数据让语言模型更懂地点

    Google Research 提出 ME-POIs 框架,将匿名移动模式作为输入特征融入语言模型的地点表示,在未见地点上将访问意图预测相对提升 81.9%、价格等级分类提升 75.1%、繁忙度估计准确率提升 24.7%。该框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,将 Gemini 等模型的语言嵌入与移动性向量对齐,并用邻近繁忙地点的访问模式缓解数据稀疏的长尾问题。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布手语转文字模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。

    推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。

8月10日周一
8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源 WeatherNext 气旋预报模型,三天预报精度媲美旧模型两天

    Google DeepMind 在 Nature 发文称其 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,三天预报精度相当于旧模型的两天,领先幅度超过 24 小时,约相当于十年气象学进展。

    推荐理由:原文给出了模型在低分辨率下取得高精度这一反直觉发现及其开放权重的入口,读者可据此评估其对现有预报工作流的可迁移价值。

8月4日周二
  1. Mistral AI61

    Mistral AI 开源 3B 多模态安全分类模型 Shieldstral

    Mistral AI 以 Apache 2.0 协议开源 3B 多模态安全分类模型 Shieldstral,它把内容审核建模为二元问答任务,推理时用自然语言写入策略即可返回校准的连续安全分数,无需重训,统一处理文本与图像。

    推荐理由:原文说明了把内容审核改写成自然语言问答的做法,读者可据此理解它如何在不重训的前提下适配不同产品策略。

7月30日周四
  1. Google DeepMind56

    Google DeepMind 发布音乐生成模型 Lyria 3.5 并上线 Google Flow Music

    Google DeepMind 宣布音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线。新版本在音乐性、歌词、人声和创作控制四方面升级:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度和结构意识提升,人声更真实且情感更细腻、发音更清晰,并支持更方便地控制输出的节奏和时长。

7月16日周四
7月15日周三
  1. Hugging Face Blog81

    Hugging Face 发布 Thinking Machines 的多模态模型 Inkling 及 Inkling-Small

    Hugging Face 上线 Thinking Machines Lab 的 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 decoder-only MoE 模型,原生支持图像、文本、音频输入与 1M 上下文,在 45 trillion token 上训练。

    推荐理由:原文给出架构细节与各部署配置的显存开销,读者可据此判断自己硬件能否跑起来。

7月8日周三
7月1日周三
6月9日周二
5月18日周一
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。

    推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。

4月30日周四
  1. Google DeepMind74

    Google DeepMind 推出 AI co-clinician 医疗研究计划

    Google DeepMind 宣布推出 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体辅助患者的三方诊疗模式。在 98 个真实初级医疗查询的盲测中,该系统在 97 例里零关键错误,医生在对照评估中更偏好其回答;在 OpenFDA RxQA 药物问答基准上,开放式提问场景表现超过其他前沿模型。

    推荐理由:原文给出了评测方法与具体结果,读者可据此判断该系统当前能力边界与适用场景。

4月16日周四
4月13日周一
4月3日周五
3月25日周三
3月17日周二