Google DeepMind 发布 Gemini 3 并推出智能体开发平台 Google Antigravity
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在 Gemini API 中以 preview 提供,200k tokens 及以下提示词定价为 $2/百万输入 tokens。
推荐理由:原文给出定价、基准分数和接入入口,读者可据此评估它能否接入现有编码与智能体工作流。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在 Gemini API 中以 preview 提供,200k tokens 及以下提示词定价为 $2/百万输入 tokens。
推荐理由:原文给出定价、基准分数和接入入口,读者可据此评估它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先推出 Gemini 3 Pro preview,并同步上线 Gemini app、AI Studio、Vertex AI、Gemini CLI 及 Search 的 AI Mode,首次在 Search 第一天接入。
推荐理由:官方给出了各基准的具体分数与开放入口,读者可据此评估其相对 2.5 Pro 的实际提升。
Google DeepMind 发布 Google Antigravity,一款面向智能体优先的开发平台,今日起免费公开预览,Gemini 3 Pro 用量提供较宽松限额。
推荐理由:原文拆解了信任、自主、反馈、自我改进四大设计原则,可迁移理解智能体产品的形态取舍。
Google Research 发布论文并推出 Generative UI,让模型针对任意提示词动态生成网页、游戏、工具和应用等交互界面,该能力以 dynamic view 和 visual layout 两项实验形式在 Gemini 应用上线。
推荐理由:原文说明了实现所需的三项关键设计和评测对比口径,读者可据此判断生成式 UI 目前的能力边界。
Google DeepMind 和 Google Research 发布 WeatherNext 2 天气预报模型,预报生成速度提升 8x、分辨率可达 1 小时,单次输入可生成数百种可能情景,每个预测在单个 TPU 上耗时不到一分钟。
推荐理由:原文说明了新模型的建模思路和落地入口,读者可据此判断它如何进入现有天气查询与业务流程。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使其从指令跟随者进化为可思考目标、与用户对话并随时间自我改进的游戏伙伴。
推荐理由:原文说明了从指令跟随到推理与自我改进的架构变化,读者可据此理解具身智能研究的路径取舍。
Google 宣布基于 Gemini 模型打造的个人健康教练将在未来一周内向美国 Fitbit Premium Android 用户推出可选公开预览,iOS 版本随后扩展。
推荐理由:原文拆解了健康教练背后的多智能体框架与评测体系,读者可了解其如何把通用模型落到具体健康场景。
Google 发布 EmbeddingGemma(google/embeddinggemma-300m),一款 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200 MB,在 MTEB 上是 500M 以下排名最高的纯文本多语言嵌入模型。
推荐理由:给出了架构改动、多框架接入方式和微调脚本,读者可据此判断如何在端侧 RAG 中落地该模型。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。
推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。
Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。
推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。
Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。
推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中推出 SynthID Text,可通过 logits processor 为 AI 生成文本添加水印并用分类器检测。
推荐理由:原文给出了配置参数、检测器训练流程和局限,读者可据此评估如何在自己的模型上落地水印方案。
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。
推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。
Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。
推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。
Google 发布开源大模型系列 Gemma,包含 7B 和 2B 两种参数规模、各有 base 与 instruction-tuned 版本,共 4 个开放模型上线 Hugging Face Hub。
推荐理由:文章给出各尺寸模型的跑分对照和单卡微调命令,读者可据此判断在自有硬件上落地的可行性。