跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 21 日 17:00
    16:24

    Anthropic 威胁报告:AI 已能执行攻击而非仅描述

    Anthropic 9 月威胁报告记录了 AI 实际执行攻击的案例,而不只是描述攻击方法。文章认为真正的 AI 风险在于…

    ↗ 查看原文 · dev.to
  2. 16:09

    解析 Transformer 机制、注意力数学与内存瓶颈

    一篇技术文章从底层拆解 Transformer 的注意力计算与内存瓶颈,指出规模化 AI 常被简化为调用 REST 接口…

    ↗ 查看原文 · dev.to
  3. 16:07

    自动推理与机器学习之争:AI该学习还是该推理

    DEV Community 发文讨论自动推理与机器学习的路线差异,指出人们谈到 AI 时通常先想到 ChatGPT、深度…

    ↗ 查看原文 · dev.to
  4. 16:04

    MSI-Bench 发布:评测多说话人语音交互

    研究者推出 MSI-Bench,用 1152 个中英各半的多方多轮音频场景评测语音智能体的多说话人记忆、指令跟随与推理。…

    ↗ 查看原文 · arxiv.org
  5. 9 月 21 日 16:00
    15:46

    解析 S7comm 协议:从 ISO-on-TCP 到 PLC 内存

    文章由 RUGERO Tesla 撰写,深入解析 S7comm 协议,从 ISO-on-TCP 传输层讲到 PLC 内存…

    ↗ 查看原文 · dev.to
  6. 15:24

    Epi-Logic:智能体认知运行时控制框架

    论文提出 Epi-Logic 概念框架,针对智能体沿用失效解释框架的 schema 错配问题,结合错配检测、自主性分级降…

    ↗ 查看原文 · arxiv.org
  7. 9 月 21 日 15:00
    14:11

    用 persona 化 LLM 模拟增强 A/B 测试

    研究者提出学习增强假设检验框架,利用质量未知的模型预测在保持统计有效性的前提下缩小实验样本量,并给出群体级与个体级两种方…

    ↗ 查看原文 · arxiv.org
  8. 9 月 21 日 14:00
    14:00

    单文件与模块化代码,哪种更不容易让 LLM 出错

    一位开发者在 DEV 社区分享实验,比较单文件与模块化代码对 LLM 表现的影响,并称实验以失败告终。作者认为模块化代码…

    ↗ 查看原文 · dev.to
  9. 13:44

    Hugging Face 论文:把 LLM 块剪枝建模为 Ising 优化问题

    Multiverse Computing 团队提出将大模型块删除(深度剪枝)的选择问题转化为受限二元优化,映射为全连接…

    ↗ 查看原文 · huggingface.co
  10. 9 月 21 日 13:00
    12:56

    针对 AI C++ 补丁的答案泄露评分器

    有开发者提出一种评分方法,用于检测 AI 生成的 C++ 补丁是否从代码中泄露的答案里获益,避免看似干净的合并掩盖问题。

    ↗ 查看原文 · dev.to
  11. 12:53

    论文提出面向AI Agent的安全事件报告框架

    研究者对比AI系统与AI Agent,结合23位学界与业界专家意见,梳理出Agent安全事件报告所需信息,如记忆与记忆访…

    ↗ 查看原文 · arxiv.org
  12. 12:46

    Decart 的 Oasis 证明 AI 生成游戏可玩

    一篇 DEV 文章讨论 Decart 的 Oasis,指出 AI 生成游戏已能在可玩帧率下运行,但作者认为“没有物理引擎…

    ↗ 查看原文 · dev.to
  13. 12:27

    DEV 社区发布 LLM 开发实用指南

    DEV Community 发布一篇 LLM 开发实用指南,指出 LLM 开发已不再只是给聊天机器人写提示词。

    ↗ 查看原文 · dev.to
  14. 12:07

    Noema 刊文:AI 正在冲击精英选拔制

    Berggruen Institute 旗下 Noema Magazine 刊出 Branko Milanović 与…

    ↗ 查看原文 · noemamag.com
  15. 9 月 21 日 10:00
    09:53

    实测 200 倍性能声明:两次都算错了

    作者对某 200 倍性能提升的说法进行实测,结果两次测量均出现偏差,复盘了 LLM 成本分类问题中的测量方法。

    ↗ 查看原文 · dev.to
  16. 09:42

    论文提出AI辅助软件开发生命周期AI-SDLC

    该研究面向受治理的Agent软件开发,提出轻量、规格驱动的生命周期,结合规格文件、AGENTS.md与分阶段技能文件,让…

    ↗ 查看原文 · arxiv.org
  17. 09:41

    LADDER:图引导扩散语言模型加速多跳推理

    研究将扩散语言模型与GraphRAG结合,提出事件驱动自时钟检索与不完整查询图传播模块,在三个多跳问答基准上平均精确匹配…

    ↗ 查看原文 · arxiv.org
  18. 09:30

    AI 中被忽视的一半:验证比生成更难

    有开发者结合自身工具实践提出,AI 落地中验证环节的难度高于生成环节,信任的工程含义值得关注。

    ↗ 查看原文 · dev.to
  19. 09:02

    神经网络入门:灵感来源与主要组成部分

    一篇科普文章介绍神经网络的基本概念,讲解其生物学灵感来源以及构成神经网络的主要组件。

    ↗ 查看原文 · dev.to
  20. 9 月 21 日 09:00
    08:11

    Taramandal-GPT:面向航天动力学的领域模型

    该框架基于Qwen3-8b,加入RAG流程与回退机制,在包含299道题的航天动力学基准APBench上,与主流开源及闭源…

    ↗ 查看原文 · arxiv.org
  21. 9 月 21 日 08:00
    07:56

    ego-browser 提出每步 DOM 一次类型化调用

    DEV Community 介绍 ego-browser 中的 System One 内循环,用每步 DOM 一次类型化…

    ↗ 查看原文 · dev.to
  22. 07:47

    小模型的置信度比它的文字更值得读

    有开发者指出,多数模型介绍只展示答案,很少展示模型如何做出判断,而后者才是关键。文章主张关注小模型的置信度信号而非生成文…

    ↗ 查看原文 · dev.to
  23. 9 月 21 日 07:00
    06:48

    孟加拉法律领域LLM蒸馏出手机端RAG模型

    研究通过两阶段渐进蒸馏将90亿参数Gemma-2压缩为20亿参数学生模型,结合稠密检索与BM25检索孟加拉国3.6万余条…

    ↗ 查看原文 · arxiv.org
  24. 9 月 21 日 06:00
    05:38

    杠杆补贴:兜底机制如何催生它想截断的尾部

    Fat Tail Notes 系列第 15 篇延续前文讨论,指出透明的兜底机制会被提前抢跑,并进一步分析其对尾部风险的影…

    ↗ 查看原文 · dev.to
  25. 05:19

    Re:CAP:面向生产 RAG 的检索覆盖率审计方法

    研究者提出 Re:CAP,通过迭代探测缺失文档来审计 RAG 检索覆盖率,无需完整相关性标注。

    ↗ 查看原文 · arxiv.org
  26. 9 月 21 日 05:00
    05:00

    AI/ML 研究摘要(2026 年 9 月 19 日)

    本期研究摘要涵盖高效长上下文记忆与 token 压缩,以及持续学习锚点与模型合并等方向。

    ↗ 查看原文 · dev.to
  27. 04:12

    AI 按能读到的合同构建,而非你本意的合同

    一篇工程随笔指出,AI 会依据它实际能读取到的合同内容来构建,而不是按开发者原本意图的合同执行。

    ↗ 查看原文 · dev.to
  28. 9 月 21 日 04:00
    03:41

    团队公开融资预测模型与失败记录:219 轮融资的经验

    该团队公开了预测方法、数据集和预测台账,其中包括首个批次 10 次全错的记录,并分享了用公开 GitHub 数据预测 A…

    ↗ 查看原文 · dev.to
  29. 9 月 21 日 03:00
    02:47

    用程序化策略搜索合成连续游戏角色行为

    研究者提出在领域特定语言上直接搜索连续空间游戏策略,生成可读程序而非神经网络控制器。结合枚举与编码智能体的 agenti…

    ↗ 查看原文 · arxiv.org
  30. 02:36

    博客:编码理论趣味入门

    一篇面向零基础读者的编码理论科普文章发布,用童年用手电筒隔窗传字母的设想引出通信编码问题,并逐步讨论如何设计不易被误读的…

    ↗ 查看原文 · paramrathour.github.io
  31. 02:20

    自训 310M 编码器与 Jev 对比:三项任务各有胜负

    开发者用 750 行数据跑了三个日语分类任务,每项 250 行、标注相同,对比自训 310M 编码器与 Jev,结果两项…

    ↗ 查看原文 · dev.to
  32. 9 月 21 日 02:00
    01:43

    Jev-Mem:System-One 控制的智能体记忆架构

    Jev-Mem 将快慢思考分工引入智能体记忆,由 System-One 控制平面负责记忆组织与检索调度,System-T…

    ↗ 查看原文 · arxiv.org
  33. 01:21

    MobileCybench:用可执行探针评测智能体漏洞发现

    研究者提出以可执行探针评估漏洞报告,并构建覆盖 13 个 Android 应用的 MobileCybench 基准,含…

    ↗ 查看原文 · arxiv.org
  34. 9 月 21 日 00:00
    00:00

    一篇数学角度批评跨语言扩散架构的文章

    DEV Community 上出现一篇题为《超越 Transformer》的文章,从数学角度批评跨语言扩散架构。目前仅能…

    ↗ 查看原文 · dev.to
  35. 23:54

    AgentForge-Bench:评测智能体伪造 PDF 文档能力

    研究者构建 AgentForge-Bench,测试现成编码智能体在真实财务 PDF 中篡改金额、日期或地址的能力。175…

    ↗ 查看原文 · arxiv.org
  36. 23:31

    XYEval:智能体面对误导性建议会大幅掉分

    研究者提出 XYEval 框架,把现有基准改造成 XY 问题评测,考察智能体能否识别用户提出的错误方向。在六个基准上测试…

    ↗ 查看原文 · arxiv.org
  37. 23:19

    字节 Seed 与清华 AIR 开源 RL 系统 DAPO

    字节 Seed 与清华 AIR 开源大规模 LLM 强化学习系统 DAPO,含算法、代码与数据集,基于 verl 框架…

    ↗ 查看原文 · github.com
  38. 9 月 20 日 22:00
    21:48

    25 个审查者组成的评审团实测有效规模仅 1.00

    作者指出生成代码的成本已大幅下降,但可信的审查没有跟上,于是增加审查者数量。用 25 个审查者组成的评审团实测,其有效规…

    ↗ 查看原文 · dev.to
  39. 21:30

    Q-TIE:面向时序信息检索的轻量重排序框架

    研究提出 Q-TIE,用学习式时序意图抽取把查询的时间约束映射为统一区间表示,兼顾时序检索器的灵活理解与时序重排序器的显…

    ↗ 查看原文 · arxiv.org
  40. 9 月 20 日 20:00
    19:14

    技术文章:模型不直接读文本,分词器决定输入

    一篇技术文章指出模型并不直接读取文本,而是由分词器决定实际输入内容,属于「从代码到权重」系列的第一篇。

    ↗ 查看原文 · dev.to
  41. 9 月 20 日 19:00
    18:55

    研究:智能体插件标准落地率仅6.2%

    论文构建含 68072 个插件包的语料库,发现仅 6.2% 通过 Agent Plugins v1.0.0 校验,但 9…

    ↗ 查看原文 · arxiv.org
  42. 18:54

    FLARE:用生成式奖励模型做编码智能体全周期监督

    研究提出 FLARE 密集监督范式,通过因果回溯蒸馏出轻量生成式奖励模型,在推理时拦截高风险步骤重执行,在训练时提供过程…

    ↗ 查看原文 · arxiv.org
  43. 18:50

    WorkWorlds:把组织状态与任务描述分离的智能体评测

    研究提出 WorkWorlds 评测基础设施,先固定组织状态与员工席位,再引入任务,避免任务描述泄露上下文。

    ↗ 查看原文 · arxiv.org
  44. 9 月 20 日 18:00
    17:59

    开发者测试发现:未被调用的技能反而提升评估效果

    开发者对三个 agent 技能各测试两次,其中一次使用 Claude Code 内置 claude 插件,结果技能评估的…

    ↗ 查看原文 · dev.to
  45. 9 月 20 日 17:00
    16:14

    Anthropic 发布首个内部 R&D 自动化指数

    Anthropic 公布首个内部 R&D 自动化指数,称 Claude 承担了 26% 的相关工作,该指数衡量的是监督而…

    ↗ 查看原文 · dev.to
  46. 9 月 20 日 16:00
    15:59

    文章称 Prompt 并不真实,主张用评估与优化流水线替代

    一篇在 Hacker News 传播的文章认为,与 LLM 交换文本的 prompt 并非本质,主张转而构建互相衔接的评…

    ↗ 查看原文 · evaluation.club
  47. 9 月 20 日 13:00
    12:20

    文章:聊天式 LLM 复刻了通灵者的骗术机制

    Baldur Bjarnason 提出 LLMentalist Effect,认为聊天式大模型让用户误以为其具有智能,而…

    ↗ 查看原文 · softwarecrisis.dev
  48. 9 月 20 日 12:00
    11:50

    发布 Agent 评分前应先冻结指标函数

    DEV Community 文章提出,Agent 评分在指标函数被冻结、哈希并测试之前,不能算作真正的测量结果。

    ↗ 查看原文 · dev.to
  49. 11:44

    VibeMemBench:评测编码智能体的记忆系统

    研究者提出 VibeMemBench,用 90 个仓库的 111 个编码任务和 3634 条历史轨迹评测记忆系统。

    ↗ 查看原文 · arxiv.org
  50. 11:34

    8 篇必读论文:Agent Harness 进展

    过去两个月 arXiv 上出现一批关于 Agent Harness 的论文,作者来自阿里巴巴 DreamX 等团队,文章…

    ↗ 查看原文 · dev.to