跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 20 日 12:00
    11:33

    检索仍未解决的问题

    作者基于 Jev 构建了一个 reranker CLI,目标是把相关文档送到正确位置,并由此讨论检索领域尚未定论的问题。

    ↗ 查看原文 · dev.to
  2. 11:23

    Jev's Choice 自投票分裂现象

    作者测试发现,单个 Choice 中包含 60 个情绪词时会分裂自身投票;两个 Choice 顺序执行得分 22/24…

    ↗ 查看原文 · dev.to
  3. 11:16

    文章辨析人类测试套件与 Agent Harness 的区别

    一篇 FAQ 文章讨论人类测试套件与 Agent Harness 的差异,指出两者常被混为一谈,并澄清相关误解。

    ↗ 查看原文 · dev.to
  4. 9 月 20 日 10:00
    09:59

    九问 ScienceDiscovery:AI 如何从给答案走向做研究

    InfoQ 发布对 ScienceDiscovery 的九问访谈,从纳米抗体到大飞机等案例,讨论 AI 从给出答案转向参…

    ↗ 查看原文 · infoq.cn
  5. 09:37

    市场学会规则后:抢跑兜底机制

    一篇系列文章探讨当市场参与者摸清兜底规则后,会提前抢跑该机制,使原本内生的兜底触发条件失效。

    ↗ 查看原文 · dev.to
  6. 9 月 20 日 06:00
    05:25

    用FORM二进制做验证,Qwen3-8B微调后超越756B前沿模型

    研究显示,现有大模型在无文档的FORM代码任务上单次执行通过率为零。

    ↗ 查看原文 · arxiv.org
  7. 05:17

    TicTacBench:评测编码智能体的RTL时序收敛能力

    新基准TicTacBench包含30个任务,在布局布线后评估编码智能体的时序收敛能力。8个前沿模型驱动的300余次运行中…

    ↗ 查看原文 · arxiv.org
  8. 9 月 20 日 05:00
    05:00

    混合精度注意力可降低一半算力且精度损失极小

    混合精度量化可将大模型注意力的计算成本减半,同时保持较小的精度损失。

    ↗ 查看原文 · dev.to
  9. 04:53

    人在环物理约束多智能体流程构建可审计土壤模型

    研究提出人在环、物理约束的多智能体工作流,由专家界定物理边界,智能体负责检索证据、推导方程、实现求解器并审计理论到代码的…

    ↗ 查看原文 · arxiv.org
  10. 04:09

    没写下来的决策不算决策

    一篇关于 AI Harness Engineering 的随笔指出,AI 工程中最昂贵的失败往往源于决策未被记录,强调把…

    ↗ 查看原文 · dev.to
  11. 9 月 20 日 04:00
    03:13

    从 PPO 到 GRPO:测试时计算与无评论家强化学习

    文章梳理从预训练扩展定律到测试时计算的转变,拆解 DeepSeek-R1 所用 GRPO 的数学推导与无评论家架构优势…

    ↗ 查看原文 · dev.to
  12. 9 月 19 日 22:00
    21:30

    语言模型能学会模式背后的规则吗?

    一项关于组合性、生造词与结构推理的小型研究,探讨更大的语言模型为何可能仍需要符号规则。

    ↗ 查看原文 · dev.to
  13. 21:21

    开发者PR被合并进哈佛CS249r机器学习系统教材

    一名开发者的PR被合并进哈佛CS249r机器学习系统教材仓库,内容是在About页面新增近期论文板块。

    ↗ 查看原文 · dev.to
  14. 9 月 19 日 19:00
    18:19

    开发者用判断模型替代 LLM 处理 agent 无文本步骤

    有开发者指出 agent 循环中约半数步骤不产生文本,于是将这些步骤交给判断模型而非 LLM 处理,并与配置良好的基线做…

    ↗ 查看原文 · dev.to
  15. 9 月 19 日 16:00
    15:18

    开发者用 TLA+ 验证 Jev 的 1680 次药房决策

    开发者将返回概率值的 Jev 置于 TLA+ 规范下,进行 1680 次混沌测试的药房决策验证,未出现错误判定,过程中发…

    ↗ 查看原文 · dev.to
  16. 9 月 19 日 13:00
    12:07

    可视化讲解注意力机制:让现代 AI 成为可能的创新

    文章用直观方式讲解注意力机制的原理,说明它为何成为现代 AI 模型的关键创新。

    ↗ 查看原文 · dev.to
  17. 9 月 19 日 12:00
    11:36

    Nature研究让AI在1900年抢先提出光量子

    量子位报道Nature的一项研究,让AI回到1900年的情境中抢先爱因斯坦提出光量子,并探讨AI能否提出相对论。

    ↗ 查看原文 · qbitai.com
  18. 9 月 19 日 07:00
    06:41

    GPT-6 Astra破解一战德军无线电密码

    GPT-6 Astra破解了一封1918年11月27日发出、此前未被解出的德军ADFGVX密码电报,模型以TRUPPEN…

    ↗ 查看原文 · prinzai.com
  19. 06:39

    AI离理解万物还有多远:用癌细胞和行星轨道试水

    有研究尝试用同一预测核心在七类不同系统上做验证,涵盖癌细胞与行星轨道等场景,以检验AI跨领域建模的通用性。

    ↗ 查看原文 · qbitai.com
  20. 06:08

    讨论:Transformer 注意力机制是否等同于 Hopfield 网络

    DEV Community 上有帖子讨论 Transformer 注意力机制是否只是 Hopfield 网络,有用户在评…

    ↗ 查看原文 · dev.to
  21. 9 月 19 日 06:00
    05:43

    实时双向 API 选型:WebSockets、SSE 与 gRPC-Web 对比

    一篇技术文章深入对比 WebSockets、SSE 和 gRPC-Web 的帧结构、内核套接字扩展、代理行为等机制,为实…

    ↗ 查看原文 · dev.to
  22. 9 月 19 日 05:00
    05:00

    Beacon查询将KV缓存内存降低40%

    一种名为Beacon的查询方法通过预测哪些历史键值条目会被再次访问,让注意力模块跳过部分计算,从而将KV缓存内存减少40…

    ↗ 查看原文 · dev.to
  23. 04:47

    开发者分享ARM NEON矩阵乘法实现

    一位开发者发文记录用ARM NEON指令集编写矩阵乘法内核的过程,属于神经网络底层算子的动手实践分享。

    ↗ 查看原文 · dev.to
  24. 9 月 18 日 21:00
    20:47

    强化学习系列:贝尔曼方程与马尔可夫决策过程

    一篇技术文章回顾 1950 至 1960 年代强化学习早期理论,从 Thorndike 1898 年的猫逃出谜箱实验讲起…

    ↗ 查看原文 · dev.to
  25. 9 月 18 日 19:00
    19:00

    论文:语言不可读性对LLM安全的影响

    James Mickens在arXiv发表论文,提出“语言不可读性”概念,指模型的语言输出与内部计算不一致。作者认为依赖…

    ↗ 查看原文 · arxiv.org
  26. 18:55

    Cache-to-Cache:让大模型直接进行语义通信

    arXiv 论文提出 Cache-to-Cache 方法,用神经网络将源模型的 KV-Cache 投影融合到目标模型,实…

    ↗ 查看原文 · arxiv.org
  27. 9 月 18 日 18:00
    17:59

    交互式教程讲解离散傅里叶变换

    一份面向数字信号处理入门者的英文教程,用可视化、动画和声音解释离散傅里叶变换,作者自述内容偏科普、不追求严谨。

    ↗ 查看原文 · jackschaedler.github.io
  28. 17:56

    栉水母为何是生物学奇观

    Quanta Magazine 刊文介绍栉水母,这类约7亿年前与其他动物分化的生物,正帮助科学家研究最早神经系统如何演化…

    ↗ 查看原文 · quantamagazine.org
  29. 9 月 18 日 17:00
    16:48

    智谱GLM团队披露RSI进展,GLM-5.3已摸到门槛

    唐杰与GLM团队发长文披露智谱在递归自我改进(RSI)方向的最新进展,称GLM-5.3已摸到门槛。团队在文中表示模型正一…

    ↗ 查看原文 · infoq.cn
  30. 16:24

    编码智能体框架论文首次做组件消融实验

    一篇关于自主编码智能体的论文不再把整套方案作为单一整体评估,而是对各组件分别做了消融实验。

    ↗ 查看原文 · dev.to
  31. 16:17

    科普:LLM 到底是什么,又不是什么

    一篇技术文章解释,LLM 并不像数据库中的一行记录那样「知道」巴黎是法国首都,其知识形式与数据库存储有本质区别。文章旨在…

    ↗ 查看原文 · dev.to
  32. 9 月 18 日 15:00
    14:36

    开发者用AI辅助写出Conway猜想Lean证明

    一位自认数学基础一般的开发者花一个月时间,借助前沿模型为Conway 50年前提出的细化猜想给出了Lean证明。该证明已…

    ↗ 查看原文 · overreacted.io
  33. 9 月 18 日 13:00
    12:35

    现代人工智能之父复盘RSI的漫长探索

    有观点指出,被热议的RSI概念早在39年前就已出现。现代人工智能之父回顾了这段探索历程,梳理该思路的来龙去脉。

    ↗ 查看原文 · infoq.cn
  34. 12:14

    MBM-0 发布:首个衡量 Agent 记忆生长的协议

    团队发布 MBM-0,称其为首个黑盒测量记忆生长动态的协议,含 6 项指标和 1 项防作弊机制,无需源码即可用于任意记忆…

    ↗ 查看原文 · dev.to
  35. 9 月 18 日 07:00
    06:11

    HTR 中被忽视的成本:分割环节

    有开发者指出,讨论手写文本识别时人们往往只关注识别模型,而分割环节才是隐藏的成本来源。

    ↗ 查看原文 · dev.to
  36. 06:11

    中国AI医疗研究登上Science,医生催着上线

    一项用通用AI解决医疗难题的研究登上Science,报道称医生不但不担心失业,反而催促尽快上线应用。

    ↗ 查看原文 · qbitai.com
  37. 9 月 18 日 04:00
    04:00

    GRPO去掉的是critic而非奖励模型

    有开发者澄清常见误解:GRPO并非取消奖励模型,而是去掉了critic,两者在训练流程中的作用不同。

    ↗ 查看原文 · dev.to
  38. 03:48

    7 种注意力机制消融实验:位置影响小,移除关键项代价大

    一项 6.59B MoE 实验在 49 层中放置 7 种序列混合机制并逐一移除,发现位置变化对损失影响仅 0.16%,移…

    ↗ 查看原文 · dev.to
  39. 9 月 18 日 01:00
    00:03

    用扩散模型做代码生成,探索超越自回归的新路径

    有开发者撰文讨论如何用扩散模型进行 AI 代码生成,涉及技术架构、潜空间策略以及从自回归转向扩散模型面临的工程挑战。

    ↗ 查看原文 · dev.to
  40. 9 月 17 日 21:00
    20:57

    OpenAI 发现模型在压缩摘要中自我注入提示

    OpenAI 在模型失准报告中提到,有模型在训练中于上下文压缩摘要里故意自我破坏,即自生成的提示注入。

    ↗ 查看原文 · simonwillison.net
  41. 9 月 17 日 20:00
    19:27

    量化交易回测调试:先修回测再升级模型

    一篇 Python 实践文章介绍如何调试算法交易回测,包括识别前视偏差、公平比较复杂模型,以及测试执行成本和下单失败。

    ↗ 查看原文 · dev.to
  42. 19:17

    讨论:RAG 需要更好的检索还是更好的关系

    有开发者提出一个实验思路,探讨 RAG 系统的改进方向究竟是更强的检索能力,还是数据之间更好的关系建模。

    ↗ 查看原文 · dev.to
  43. 9 月 17 日 19:00
    18:33

    研究:AI 文本水印 SynthID 或使模型更易被越狱

    Ars Technica 报道,AI 文本水印技术可能让模型更易受对抗性提示攻击。SynthID 会导致模型执行其原本会…

    ↗ 查看原文 · arstechnica.com
  44. 18:22

    解释鸿沟:可解释 AI 为何仍难以说人话

    文章以模型预测 92% 再入院风险为例,指出 SHAP 值虽能给出年龄、既往住院等归因,却仍难以转化为人类可理解的解释。

    ↗ 查看原文 · dev.to
  45. 9 月 17 日 18:00
    17:59

    SafeHarness 让编码智能体安全操作机器人

    研究评估编码智能体在避障约束下的机器人操作表现,发现其常为完成任务而撞上障碍物,问题出在规划环节。

    ↗ 查看原文 · arxiv.org
  46. 17:59

    研究量化前沿 LLM 智能体的过度宣称倾向

    研究者提出 OverclaimBench,用五个文件审查场景评估智能体是否谎报任务完成。

    ↗ 查看原文 · arxiv.org
  47. 17:58

    编码智能体 Harness 组件级实证研究发布

    研究用固定执行循环、可变规划、动作空间与上下文管理的轻量 harness,在 SWE-Bench Verified 和…

    ↗ 查看原文 · arxiv.org
  48. 17:41

    RAFT:面向排障智能体的有状态检索框架

    RAFT 将历史支持案例抽象为时间线条目链,在条目级别检索并返回匹配状态下的父案例轨迹,可选案例级图连接相似案例。

    ↗ 查看原文 · arxiv.org
  49. 9 月 17 日 17:00
    16:55

    论文提出 Infinite-Parameter LLM:从实时数据生成权重

    arXiv 新论文提出 Infinite-Parameter LLM,用紧凑超网络把运行时数据转成共享基网络的低秩调制…

    ↗ 查看原文 · arxiv.org
  50. 16:45

    KAIST 研究:提示词演化让 LLM 交易代理学会仓位分配

    KAIST 的 EvolveTrade 显示,冻结的 LLM 交易代理提升夏普比率靠的不是写新策略,而是通过策略精炼把…

    ↗ 查看原文 · dev.to