跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 11 日 15:00
    14:59

    用 ConvLSTM 加传感器数据识别激进驾驶

    一篇 DEV 文章尝试仅靠智能手机传感器数据,用 ConvLSTM 模型识别激进驾驶行为,无需额外专用硬件。

    ↗ 查看原文 · dev.to
  2. 14:24

    同一模型换 4 种分词器,准确率差 30 个百分点

    一篇 DEV 文章对比同一模型、同一数据下 4 种分词方式,结果显示准确率差距达到 30 个百分点,说明分词方案对结果影…

    ↗ 查看原文 · dev.to
  3. 9 月 11 日 14:00
    13:33

    开发者称多数 AI 推理轨迹只是把答案倒着写出来

    DEV Community 一篇文章指出,多数 AI 展示的逐步推理过程可能只是把最终答案倒推着写出来,而非真正的推理链…

    ↗ 查看原文 · dev.to
  4. 9 月 11 日 12:00
    11:57

    研究:AI 生成的弱测试会让编码 Agent 表现更差

    Critic 研究发现,质量差的生成测试会降低修复成功率,并给出可运行的 Python 示例,用于识别会放行错误修复的测…

    ↗ 查看原文 · dev.to
  5. 11:41

    模型之间互相认同,其实是在认同自己

    一篇技术文章指出,多个模型给出的答案高度一致,可能并非独立验证,而是模型在重复自身已有的偏好与输出。

    ↗ 查看原文 · dev.to
  6. 11:17

    观点文章:AI 正让科研协作变得更少

    Holtzbrinck 集团首席科学官 Daniel Hook 撰文提出「Waymo 效应」,认为像无人车这类无摩擦技术…

    ↗ 查看原文 · researchagenda.news
  7. 9 月 11 日 09:00
    08:44

    两个主题 LoRA 适配器实验:各自表现与留出权衡

    DEV Community 发布一篇实验记录,测试两个针对不同主题的 LoRA 适配器能否共存。结果显示 LoRA 在各…

    ↗ 查看原文 · dev.to
  8. 08:06

    UI 测试难题:如何判断两个按钮是同一个按钮

    有开发者提出 UI 测试中的基础问题:如何确认页面上的某个元素与之前是同一个,这一看似简单的判断并不容易。

    ↗ 查看原文 · dev.to
  9. 9 月 11 日 05:00
    04:02

    OpenAI 并未解决纳维-斯托克斯方程

    有文章指出 OpenAI 用 1 万个智能体、1300 亿 token 只拿到一份 Lean 证明,并未解决纳维-斯托克…

    ↗ 查看原文 · dev.to
  10. 9 月 11 日 02:00
    01:46

    爆料称 OpenAI 用千禧年难题霍奇猜想做 Benchmark

    有爆料称 OpenAI 将千禧年数学难题霍奇猜想用作模型评测基准。消息尚未得到官方确认,具体细节不明。

    ↗ 查看原文 · qbitai.com
  11. 9 月 11 日 01:00
    00:53

    GLM-5.3 聚焦后训练环节的改进

    一篇 DEV 社区文章讨论智谱 Z.ai 的 GLM-5.3,称其在后训练环节的调整正在改变 AI 开发方式,但摘要未给…

    ↗ 查看原文 · dev.to
  12. 00:39

    法院判决预测模型目标泄漏从 92% 降至 0.1%

    有开发者称在法院判决预测任务中把目标泄漏从 92% 降到 0.1%,并基于此搭建了一个 MCP Server。

    ↗ 查看原文 · dev.to
  13. 00:33

    YuE2 发布:符号规划与音频生成统一的音乐模型

    MBZUAI 等机构发布 YuE2,将符号与音频音乐生成统一在一个约 3.59B 参数模型中,先写出可编辑乐谱再生成人声…

    ↗ 查看原文 · map-yue2.github.io
  14. 9 月 10 日 21:00
    20:15

    Google 绘制出完整雄性果蝇大脑连接图谱

    Google Research 与合作者发布了成年雄性果蝇大脑的完整神经连接图谱,被视为连接组学领域的一项重要进展。

    ↗ 查看原文 · dev.to
  15. 9 月 10 日 20:00
    19:15

    Agent 通过 SWE-Bench Pro 因 git show 仍留有修复

    上海 AI Lab 于 9 月 8 日发布 SWE-Bench Pro Verified。当 gold patch 移出…

    ↗ 查看原文 · dev.to
  16. 19:07

    博客:下一代 Transformer 的循环结构并非关键

    一篇技术博客讨论 Loop Transformer,认为应区分 Loop 与 Recursive 两类结构,并称权重共享…

    ↗ 查看原文 · zartbot.github.io
  17. 9 月 10 日 19:00
    18:02

    SHAP 难以解释智能体式 AI 欺诈

    文章探讨 SHAP 在自主欺诈智能体场景下的解释局限,并介绍新的可解释性方法以建立信任。

    ↗ 查看原文 · dev.to
  18. 9 月 10 日 18:00
    17:23

    Anthropic 发布 2026 年 9 月 AI 滥用检测与反制报告

    Anthropic 威胁情报团队披露 2025 年 12 月至 2026 年 8 月间阻断的恶意使用案例,涉及网络攻击…

    ↗ 查看原文 · anthropic.com
  19. 9 月 10 日 17:00
    16:12

    RAG-Safety-Bench:评估检索增强 LLM 安全性

    研究者提出 RAG-Safety-Bench,用于衡量检索增强生成对 LLM 安全性的影响。

    ↗ 查看原文 · arxiv.org
  20. 9 月 10 日 16:00
    15:43

    论文:智能体时代的可复现性与上下文工程

    一篇论文提出,可复现研究实践本质上就是为 AI 编程智能体做上下文工程。作者认为智能体降低了维护测试、提交历史、仓库结构…

    ↗ 查看原文 · arxiv.org
  21. 9 月 10 日 15:00
    14:46

    四色定理罕见迎来新证明

    数学家重新审视这一 1970 年代借助计算机证明的著名问题,获得了关于图结构性质的重要新见解。

    ↗ 查看原文 · quantamagazine.org
  22. 14:27

    《AI 2027》情景预测再受关注

    Daniel Kokotajlo 等人撰写的《AI 2027》预测未来十年超人类 AI 的影响将超过工业革命,并给出「放…

    ↗ 查看原文 · ai-2027.com
  23. 14:23

    用 NLP 方法分析 Apple 相关推文情感

    一篇开发者文章以 Apple 新品发布时的社交媒体讨论为例,介绍基于 NLP 的推文情感分析方法。

    ↗ 查看原文 · dev.to
  24. 14:03

    EXYGEN 框架实现大规模知识图谱对话式访问

    研究者提出 EXYGEN 框架,用 VoID 描述与 ShEx 模式构建 RAG 流程,无需微调即可在 SciQA 上达…

    ↗ 查看原文 · arxiv.org
  25. 9 月 10 日 14:00
    13:36

    开源记忆层 nautilus-compass 在 LongMemEval-S 检索上超过 mem0

    开源 agent 记忆层 nautilus-compass 在 LongMemEval-S 全量 500 条检索评测中…

    ↗ 查看原文 · dev.to
  26. 13:06

    开发者将 JPEG AI 移植到 Apple 芯片,首次基准测试耗时多在启动

    有开发者用 Core ML 实现了原生 JPEG AI 编解码器,并给出真实的 y、z 激活图。作者指出首次测试耗时约五…

    ↗ 查看原文 · dev.to
  27. 9 月 10 日 13:00
    12:59

    赛诺菲合作研究:多层知识图谱用于 CMC 工艺开发

    研究团队提出模块化智能体平台,将工艺开发文档转为双层知识图谱,在赛诺菲小分子项目 505 个问题上取得 95% 一级选择…

    ↗ 查看原文 · arxiv.org
  28. 12:57

    研究提出「约定差距」指标衡量 AI 隐含沟通能力

    研究者用 Hanabi 游戏提出「约定差距」指标,回放约 10.1 万次对局发现人类配对差距为 +26.2 个百分点,A…

    ↗ 查看原文 · arxiv.org
  29. 12:46

    王梦迪:AI 尚未发现新的基础科学

    普林斯顿终身教授王梦迪在演讲中表示,当前 AI 尚未发现新的基础科学,并就此展开讨论。

    ↗ 查看原文 · infoq.cn
  30. 9 月 10 日 12:00
    11:25

    VikingRAG:面向结构化文档的高效检索增强生成

    研究者提出目录感知的语义数据管理系统 VikingRAG,通过复用多轮检索轨迹与自适应升级策略,在保持精度的同时将 to…

    ↗ 查看原文 · arxiv.org
  31. 9 月 10 日 11:00
    10:01

    机器学习做客户流失预测的实践总结

    一篇 DEV 文章讨论客户流失预测中真正有效的做法,指出留存电话等动作本身可能提醒客户离开,因此预测与干预需要分开考虑。

    ↗ 查看原文 · dev.to
  32. 9 月 10 日 10:00
    09:31

    研究:ChatGPT 使用方式多样性比是否使用更影响安全编码成绩

    一项针对 26 名网络安全硕士生的实证研究发现,不同经验水平的学生使用 ChatGPT 的策略大体相似,使用模式多样性与…

    ↗ 查看原文 · arxiv.org
  33. 09:25

    AgentZip:面向 AI Agent 沙箱的内存压缩系统

    研究者提出 AgentZip,利用沙箱共享模板与跨沙箱的内存冗余做压缩,在 LLM 训练与推理负载下将沙箱内存最多降低…

    ↗ 查看原文 · arxiv.org
  34. 9 月 10 日 09:00
    08:14

    REVA:用可复用证据视图降低 RAG 上下文成本

    研究提出 REVA 框架,把历史查询与文档的注意力痕迹聚合为可复用的证据视图,在四个基准上生成质量提升 1.0 至 5.…

    ↗ 查看原文 · arxiv.org
  35. 9 月 10 日 08:00
    07:57

    大晓机器人等发布人–场景交互重建框架HSImul3R

    大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人–场景交互重建框架HSImul3R,可将人类视频转化为机器…

    ↗ 查看原文 · qbitai.com
  36. 07:34

    SemVerBench:首个评测 LLM 版本约束解析语义的基准

    研究者发布 SemVerBench,覆盖 npm、PEP 440、Cargo 三个生态共 240 道可机器校验题目,测试…

    ↗ 查看原文 · arxiv.org
  37. 07:27

    BrainStem_V8 神经符号 AI 提出需要睡眠

    有开发者介绍神经符号 AI 项目 BrainStem_V8,提出下一代 AI 需要类似睡眠的机制,并给出五条来自生物数字…

    ↗ 查看原文 · dev.to
  38. 9 月 10 日 06:00
    05:34

    研究:多智能体 LLM 质性编码的准确率与争论强度相关

    一项研究让多个 AI 智能体独立编码、辩论并调和分歧,发现编码准确率受码本长度、数据相似度和智能体分歧影响,激烈且未解决…

    ↗ 查看原文 · arxiv.org
  39. 9 月 10 日 05:00
    05:00

    随机注意力去掉打分环节,吞吐量翻倍

    有开发者提出随机注意力方法,丢弃注意力分数后 LLM 生成速度最高提升 43%,性能下降很小。

    ↗ 查看原文 · dev.to
  40. 04:54

    近似推断:采样后验还是优化近似分布

    一篇技术文章讨论概率模型中的后验推断,对比采样后验与优化近似分布两种思路,说明二者在实现方式和适用场景上的差异。

    ↗ 查看原文 · dev.to
  41. 04:32

    arXiv 发布 SaltBench:用机器裁判衡量编码智能体方法效果

    该协议让证明内核或程序验证器等机器裁判决定智能体工作价值,智能体无法申辩。研究用 Rust 编写五个组件测试四种配置,发…

    ↗ 查看原文 · arxiv.org
  42. 04:12

    MOSAIC:面向 GraphRAG 的查询感知探索策略

    该免训练框架把 GraphRAG 检索建模为逐查询控制问题,由 LLM 分析器生成种子选择、图遍历与停止策略。

    ↗ 查看原文 · arxiv.org
  43. 9 月 10 日 04:00
    04:00

    有人实测 RoPE 长上下文外推,结论是不行

    有开发者对 RoPE 能外推到更长上下文的说法做了实测,结果显示该能力并不成立,相关结论此前多被默认接受。

    ↗ 查看原文 · dev.to
  44. 03:20

    Agent Incident Registry:建立 AI 智能体事故登记库

    该登记库以来源可追溯的方式收录智能体相关事件,含证据、稳定标识及因果角色、披露类别、机制与结果标签。作者称其支持案例检索…

    ↗ 查看原文 · arxiv.org
  45. 03:05

    科普文章介绍深度学习与 Transformer

    一篇 DEV 社区文章介绍深度学习与 Transformer 的基本概念,属于面向入门读者的科普内容。

    ↗ 查看原文 · dev.to
  46. 03:02

    RCL:检测企业代码生成中检索上下文不足

    该轻量模块置于检索与生成之间,结合调用图结构覆盖度与新颖度评分,在生成前判断检索是否充分。低于阈值时触发补充检索或标记人…

    ↗ 查看原文 · arxiv.org
  47. 9 月 10 日 03:00
    03:00

    实验:TinyStories 的关键是领域而非词表

    作者将词表限制在 1500 词复现 TinyStories,结果 top-1 比 4000 词上限差 4 个百分点,超三…

    ↗ 查看原文 · dev.to
  48. 02:50

    综述:AI 智能体定义、指标与基准汇编

    该综述围绕环境交互、学习适应、自主性、目标导向行为和时间一致性五个维度梳理智能体能力的概念与评测方法,并推出公开数字资源…

    ↗ 查看原文 · arxiv.org
  49. 9 月 10 日 02:00
    01:59

    博客提出基于规格博弈的AI对齐新思路

    SLIME MOLD TIME MOLD 博客借 DeepMind 安全研究整理的规格博弈行为清单,提出一个AI对齐的设…

    ↗ 查看原文 · slimemoldtimemold.com
  50. 01:49

    开发者分享从零实现 MLP 的学习经历

    一位开发者撰文记录自己学习机器学习、并从零实现多层感知机(MLP)的过程,属于个人学习经验分享。

    ↗ 查看原文 · dev.to