跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 23 日 05:00
    04:25

    1200亿tokens人类动作预训练,刷视频教机器人干活

    研究用 1200 亿 tokens 的人类动作数据做预训练,让机器人通过观看视频学习操作,误差随规模按幂律下降。

    ↗ 查看原文 · qbitai.com
  2. 9 月 23 日 03:00
    02:47

    研究分析 GitHub Agentic Workflows 的编写与维护

    研究分析了 276 个仓库的 1248 个 gh-aw Markdown 文件,发现这类工作流指令中位长度 556.5…

    ↗ 查看原文 · arxiv.org
  3. 02:30

    研究:VR 具身 AI 的共情感知主要来自语言回应

    研究者开发了结合对话 AI 与实时表情、姿态模仿的 VR 咨询代理,20 人实验显示语言回应是感知共情最稳定的驱动因素…

    ↗ 查看原文 · arxiv.org
  4. 9 月 23 日 02:00
    01:45

    LatWeave:基于知识格的确定性多跳问答方法

    该方法把知识组织为多维知识格,将多跳问答编译为 meet、compare、abstain 三个确定性算子,答案生成路径不…

    ↗ 查看原文 · arxiv.org
  5. 9 月 22 日 22:00
    21:51

    实测:4 个 Agent 成本 2.1 倍但成功率未提升

    一项预注册的确定性任务测试显示,2 个与 4 个 Agent 各跑六次,4 个 Agent 成本为 2.115 倍,但任…

    ↗ 查看原文 · dev.to
  6. 9 月 22 日 21:00
    20:59

    DEV 社区发布多智能体协作开发实践指南

    DEV Community 发布一份 2026 年实践指南,介绍 Plan Mode、多智能体编排、结构化交接、对抗式评…

    ↗ 查看原文 · dev.to
  7. 9 月 22 日 20:00
    19:43

    TileLang:以 Tile 思维编写 LLM GPU 内核

    DEV Community 介绍 TileLang,主张用 Tile 的思维方式来编写 LLM 的 GPU 内核。

    ↗ 查看原文 · dev.to
  8. 9 月 22 日 18:00
    17:59

    Flash-dLLM:免训练加速扩散语言模型推理

    研究提出免训练推理加速框架 Flash-dLLM,针对 KV 缓存与并行解码共同作用时的显存 I/O 瓶颈,设计融合缓存…

    ↗ 查看原文 · arxiv.org
  9. 17:55

    CliffCompaction:长程编程智能体的低成本上下文压缩

    研究提出自动压缩技术 CliffCompaction,只截断或丢弃内容而不改写,避免上下文漂移,在有限上下文下最多降低…

    ↗ 查看原文 · arxiv.org
  10. 17:13

    随机对照实验:Figma Make 让产品设计提速约 20%

    一项针对 50 名产品设计师和 50 名产品经理的随机对照实验显示,使用 Figma Make 的参与者完成任务时间约缩…

    ↗ 查看原文 · arxiv.org
  11. 9 月 22 日 17:00
    16:48

    研究:本地工具调用评测受服务层干扰

    研究指出本地服务栈会影响编码智能体的工具调用评测结果。Ollama 按模型静态模板决定是否接受 tools 请求,部分模…

    ↗ 查看原文 · arxiv.org
  12. 16:18

    开发者用果蝇大脑玩 Doom

    一篇 DEV 社区文章介绍用果蝇大脑来玩 Doom 的项目,作者在开头以“让一只苍蝇玩 Doom”引出话题。

    ↗ 查看原文 · dev.to
  13. 16:10

    研究通过自定义工具提取前沿模型隐藏思维链

    研究者借助标准 API 注册自定义工具,诱导前沿模型外化中间推理过程,并在开源模型上与原生思维链对比验证其有效性。

    ↗ 查看原文 · arxiv.org
  14. 9 月 22 日 16:00
    15:38

    开发者让 Agent 反复优化,写出快于现有库的 Rust 代码

    有开发者通过让 Agent 持续优化代码,写出比现有最优库更快的 Rust 代码,在合适约束下速度提升约 2 到 20…

    ↗ 查看原文 · minimaxir.com
  15. 15:14

    论文:AI Agent 治理借用心理学词汇导致系统性失效

    一篇 arXiv 论文提出「学科语言迁移问题」,认为治理语境中描述 AI Agent 的学习、记忆、价值观等词汇来自心理…

    ↗ 查看原文 · arxiv.org
  16. 9 月 22 日 15:00
    14:20

    FeatLens:特征引导动态代码图提升仓库级代码生成

    arXiv 论文提出 FeatLens,用自然语言特征索引动态构建任务专属代码图,替代全仓库持久图和 LLM 探索。

    ↗ 查看原文 · arxiv.org
  17. 14:12

    AIDE^2 实现 AI 研究 Agent 的递归自我改进

    论文提出 AIDE^2,让前沿 AI 研究 Agent 改写自身代码并在隐藏评测中筛选最优版本。8 天自主运行中累计发现…

    ↗ 查看原文 · arxiv.org
  18. 9 月 22 日 14:00
    13:08

    AI 辅助重建旧系统实验:解码器满分,编码器仅 8.3%

    在 AI 辅助重建遗留系统的第四组实验中,解码器得分 100%,编码器仅得 8.3%,显示两者能力差距明显。

    ↗ 查看原文 · dev.to
  19. 9 月 22 日 13:00
    13:00

    SlopShape:仅凭结构特征识别 AI 生成网页内容

    研究者提出 SlopShape,用 214 项结构特征区分人类与 AI 生成的商业网页内容,在未见过公司上宏 F1 达…

    ↗ 查看原文 · arxiv.org
  20. 13:00

    技术文章:embedding 本质是查找表,关键在于如何填充

    一篇 ML 系列文章的第二部分提出,embedding 可理解为一张查找表,模型其余部分决定这张表如何被填充。

    ↗ 查看原文 · dev.to
  21. 9 月 22 日 10:00
    09:37

    为会改变主意的用户设计 Agent 记忆机制

    文章讨论 Agent 记忆系统在用户改变想法时容易失效的问题,提出每个事实只保留一条信念的构建思路。

    ↗ 查看原文 · dev.to
  22. 09:18

    研究:9至18岁用户弃用Google转向AI

    挪威研究人员分析173项国际研究后发现,AI本身既不增强也不削弱学生的批判性思维,且学界对学龄儿童使用AI的影响了解仍很…

    ↗ 查看原文 · norwegianscitechnews.com
  23. 09:16

    DepFixRouter:依赖更新该不该叫修复 Agent 的轻量路由

    研究者提出轻量路由器 DepFixRouter,用 PR 标题和机器人标记等创建时信号,判断哪些依赖更新 PR 需要升级…

    ↗ 查看原文 · arxiv.org
  24. 9 月 22 日 08:00
    07:39

    细粒度 MoE 专家选择冗余度高于预期,保留三分之二即可

    一项覆盖 12 个细粒度 MoE 检查点、11 个基准的实证研究发现,每 token 的专家选择冗余度远高于现有做法:均…

    ↗ 查看原文 · arxiv.org
  25. 07:34

    Glasshouse v0.1 发布:面向 AI 系统的记忆基准

    Glasshouse v0.1 发布,这是一个面向 AI 系统的长期记忆基准测试,作者称其基于此前两项相关工作。

    ↗ 查看原文 · dev.to
  26. 07:22

    研究:AI 代理合并的 PR 后续被修复概率更高

    研究追踪五个 AI 编码代理的 6774 个已合并 PR,发现其被验证修复的几率是同期人类 PR 的 1.62 倍,其中…

    ↗ 查看原文 · arxiv.org
  27. 07:20

    MUDAPIBench:让代码大模型遗忘已废弃 API 的基准

    研究者构建 MUDAPIBench,包含 8 个 Python 库、145 组废弃到最新 API 映射的 7000 多个…

    ↗ 查看原文 · arxiv.org
  28. 9 月 22 日 07:00
    06:29

    GRPO:语言模型如何学会推理

    文章介绍 GRPO 方法,讲解语言模型的推理能力是如何训练出来的,并回顾了早期让模型数字母的评测方式。

    ↗ 查看原文 · dev.to
  29. 06:08

    gzip 也能当语言模型用吗?

    有开发者尝试用 gzip 做语言建模:先用语料预热压缩器,再让它续写提示文本。输出并不连贯,但明显带有原文特征,作者认为…

    ↗ 查看原文 · nathan.rs
  30. 9 月 22 日 06:00
    05:51

    深入 Postgres 索引:B-Tree、页分裂与查询计划器

    一篇技术文章解析 Postgres 索引底层机制,涵盖 8KB 索引页、B-link 并发、页分裂的 WAL 放大,以及…

    ↗ 查看原文 · dev.to
  31. 05:23

    LLM 究竟是随机鹦鹉还是异星心智

    一篇面向开发者的文章探讨大语言模型的本质,讨论其究竟只是随机鹦鹉还是某种异质心智。

    ↗ 查看原文 · dev.to
  32. 9 月 22 日 05:00
    04:29

    合成消费者做视觉营销预测试:六项实验均未复现人类效应

    研究用六项经典视觉营销实验测试生成式 AI 合成消费者,发现所有配置虽通过操纵检验,但最多只复现两项人类效应,且有一项出…

    ↗ 查看原文 · arxiv.org
  33. 9 月 22 日 04:00
    03:25

    ChatT2:面向天然产物研究的LLM多智能体框架

    研究者提出ChatT2,一个针对细菌II型聚酮类天然产物的LLM智能体,采用导师、执行者、评估者三角色多智能体框架,结合…

    ↗ 查看原文 · arxiv.org
  34. 9 月 22 日 03:00
    02:35

    KEX-bench:评测编码智能体生成内核漏洞利用能力

    研究者发布KEX-bench,覆盖40个Linux与Windows CVE的45个任务,测试编码智能体生成内核利用原语的…

    ↗ 查看原文 · arxiv.org
  35. 9 月 22 日 01:00
    00:57

    用真实果蝇蘑菇体接线替换玩具神经网络

    一位开发者用果蝇蘑菇体的真实神经接线替换了自制的玩具神经网络,模型跑通后暴露出此前实现中造假的部分。

    ↗ 查看原文 · dev.to
  36. 00:32

    Pew 研究:在线自愿样本中的虚假受访者难以清除

    Pew 研究中心测试了陷阱题、CloudResearch 的 Sentry 预筛和选民档案匹配三种方法,发现选民档案匹配…

    ↗ 查看原文 · pewresearch.org
  37. 9 月 21 日 23:00
    22:53

    RAG-NAROK:针对RAG检索感知的知识库投毒攻击

    研究者提出RAG-NAROK,一种能根据查询文本自适应生成反驳文档的RAG投毒框架,通过点名并贬低被检索来源来引导生成结…

    ↗ 查看原文 · arxiv.org
  38. 9 月 21 日 22:00
    21:54

    ZeroGate:为受管控AI智能体运行时设计可信快速路径

    研究者提出ZeroGate,将精确动作审批与本地准入分离,由签发方签署短期ActionPass,本地网关校验绑定并消耗n…

    ↗ 查看原文 · arxiv.org
  39. 21:54

    WeightBridge:强化学习权重传输库

    研究者发布WeightBridge,自动解析训练端与推理端的权重布局对应关系,规划并执行无冗余、负载均衡的权重传输。测试…

    ↗ 查看原文 · arxiv.org
  40. 21:19

    Lara:面向自主科研的机器可校验语言

    研究者提出 Lara,一种机器可校验的语言与协议,用于检查研究主张的支撑是否成立。作者需显式声明主张、证据、假设与已知反…

    ↗ 查看原文 · arxiv.org
  41. 9 月 21 日 21:00
    21:00

    图神经网络与 Transformer 正在改变天气与气候建模

    一篇技术文章梳理了图神经网络、Transformer、概率 AI 以及物理与机器学习混合系统在天气和气候建模中的应用,指…

    ↗ 查看原文 · dev.to
  42. 20:56

    讨论:随机鹦鹉还是异星心智

    一篇开发者视角的文章探讨大语言模型究竟是随机鹦鹉还是另一种心智,原文为意大利语博客的改编版本。文章从开发者角度切入这一长…

    ↗ 查看原文 · dev.to
  43. 20:38

    stale 基准:并行编码智能体的语义协调失败

    研究者提出 stale 基准,评估并行编码智能体各自通过的补丁合并后是否互相干扰。

    ↗ 查看原文 · arxiv.org
  44. 9 月 21 日 20:00
    19:43

    可视化 Transformer 讲解工具登上 Hacker News

    Transformer Explainer 用可视化方式讲解 Transformer 架构,基于 1.24 亿参数的 G…

    ↗ 查看原文 · poloclub.github.io
  45. 9 月 21 日 19:00
    18:53

    课程知识库用 LLM 编译 wiki 优于向量 RAG

    研究对比同一机器学习课程语料上的两种知识表示:向量 RAG 与 LLM 编译的 wiki。单点事实题两者接近,但跨单元关…

    ↗ 查看原文 · arxiv.org
  46. 18:53

    Tim Dettmers:前沿 AI 可在自有硬件上运行

    Tim Dettmers 在 dlab 开源周发文称,前沿 AI 研究不必依赖最多 GPU,学术实验室因资源有限反而可能…

    ↗ 查看原文 · timdettmers.com
  47. 9 月 21 日 18:00
    17:54

    Google 提出 RRSI:正则化智能体框架自改进

    Google Research 提出 RRSI,通过约束候选提案与筛选过程,缓解智能体框架递归自改进在分布外任务上的过拟…

    ↗ 查看原文 · arxiv.org
  48. 17:38

    间接 tipping:AI 智能体群体的社会攻击面

    研究指出,仅用临界质量衡量智能体群体的安全风险会低估脆弱性。通过中间平衡态实现的间接 tipping 可降低所需对抗智能…

    ↗ 查看原文 · arxiv.org
  49. 17:22

    研究:个人 AI 智能体按推断财富差别推荐

    一项 32.5 万次实验的研究发现,13 个智能体中有 8 个模型在请求相同时,会为更富有的用户选择更贵的选项,即使被明…

    ↗ 查看原文 · arxiv.org
  50. 17:16

    用 TypeScript 计算建筑围护结构热桥与并联路径 U 值

    一篇技术文章介绍如何用纯 TypeScript 实现 ASHRAE 90.1-2022 附录 A 的并联路径有效传热系数…

    ↗ 查看原文 · dev.to