跳到正文

#端侧

今日 0 条
9月29日周二
  1. TechCrunch · AI45

    DetectifAI:祖父遭深度伪造语音诈骗后,创始人推出端侧语音检测 SDK

    DetectifAI 推出可在智能手机操作系统内运行的紧凑 AI 模型,能在通话、语音消息等场景即时判断声音是否由 AI 生成,且音频不离开设备。该公司以 SDK 形式授权给手机厂商,目前已为印度金融机构每月处理超过 100,000 通电话,提供深度伪造检测与说话人验证。据 FBI 数据,美国人去年因 AI 驱动诈骗损失近 $900 million,较 2024 年增长 24%。

9月22日周二
9月16日周三
8月14日周五
  1. Hugging Face Blog61

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,覆盖六大发现。公开模型仓库从 2.43 增至 2.96 百万,但 85.6% 模型下载不足 200 次,1.5% 仓库占 99.2% 下载量;中国实验室月度最大开源模型参数在 754B 至 2.78T 之间,多款超 100B 美国模型基于中国模型构建。

    推荐理由:报告用下载、衍生模型、许可证等多组数据拆解了开源生态的注意力与实际采用差异,可迁移的判断框架清晰。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布手语转文字模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。

    推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。

8月11日周二
8月10日周一
7月1日周三
6月27日周六
6月13日周六
6月11日周四
  1. Google DeepMind74

    Google DeepMind 开源实验性扩散文本模型 DiffusionGemma,推理提速最高 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。

    推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。

6月9日周二
5月29日周五
  1. Google Research67

    Google Research 发布 I/O 2026 研究成果综述

    Google Research 发布 I/O 2026 综述,介绍其在科学发现、健康、边缘计算、天气预测、Gemini 核心能力、开发者生产力、隐私保护和量子计算等方向的研究与产品进展。

    推荐理由:官方长文系统梳理了研究到产品的转化路径,读者可据此理解其各条线的布局重点。

5月28日周四
4月3日周五
5月7日周三