跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 14 日 03:00
    02:21

    文章分析3.07倍放大背后的机制与分布问题

    一篇技术文章指出,在9月4日的市场状态下,-5%的冲击被放大为-15.4%,即3.07倍,作者认为单一倍数掩盖了机制与分…

    ↗ 查看原文 · dev.to
  2. 9 月 14 日 01:00
    00:10

    Dream-RSI:通过演化世界实现递归自我改进

    研究者提出 Dream-RSI 框架,用历史发现树构建回放模拟器,以低成本离线反馈优化探索策略,再部署回线上继续搜索。在…

    ↗ 查看原文 · arxiv.org
  3. 9 月 14 日 00:00
    23:20

    El Agente Potente:高通量智能体原子模拟系统

    研究者推出 El Agente Potente,将类型化执行图与编码模式结合用于机器学习势驱动的原子模拟,LLM 只负责…

    ↗ 查看原文 · arxiv.org
  4. 23:03

    论文:用编码智能体自动超特化SAT求解器

    研究提出「自动超特化」,用编码智能体为单一输入类别生成专用软件。在SAT求解上,每个专用求解器平均成本37美元,性能平均…

    ↗ 查看原文 · arxiv.org
  5. 9 月 13 日 23:00
    22:52

    Enemray:面向哈桑尼亚语的语言模型

    研究团队发布以哈桑尼亚语为中心的语言模型Enemray,采用稳定性—可塑性目标,在获得该语言能力的同时保留基座模型的推理…

    ↗ 查看原文 · arxiv.org
  6. 9 月 13 日 21:00
    20:51

    用 Java 责任链模式构建订单处理流水线

    一篇教程介绍如何用 Java 的责任链模式搭建订单处理流水线,把校验、处理等环节拆成可组合的处理器依次执行。

    ↗ 查看原文 · dev.to
  7. 20:46

    Holdout Ledgers 让智能体评分更可信

    有文章讨论智能体评分问题,认为只有任务账本、指标和控制项可核验时,百分比分数才算真正的测量结果。

    ↗ 查看原文 · dev.to
  8. 9 月 13 日 20:00
    19:52

    TriCalRAG:本地化LLM根因分析基准

    研究提出TriCalRAG基准,在单张96GB工作站GPU上用vLLM本地部署开源模型做AIOps根因分析。

    ↗ 查看原文 · arxiv.org
  9. 19:43

    AI 的三条扩展定律:从训练更多转向思考更多

    开发者 Rijul 在文章中讨论 AI 的三条扩展定律,主题是从增加训练量转向增加推理时的思考量,其正在构建 AI 代码…

    ↗ 查看原文 · dev.to
  10. 19:16

    AcquireBound:AI智能体资源获取的运行时授权

    研究提出AcquireBound运行时授权架构,针对智能体获取算力、凭证、账号等资源后的「激活缺口」,先隔离输出、解析实…

    ↗ 查看原文 · arxiv.org
  11. 9 月 13 日 19:00
    18:59

    法律领域奖励模型:面向依据与拒答

    研究提出将现有法律问答数据转为上下文偏好数据的框架,并构建LegalRewardBench基准,用于评估检索增强下的法律…

    ↗ 查看原文 · arxiv.org
  12. 18:41

    评估集可能混进了训练集:十分钟自查方法

    有文章指出训练集与测试集污染会悄悄抬高基准分数,并给出三种值得衡量的重叠程度,以及不写脚本、直接比对两个文件的检查方式。

    ↗ 查看原文 · dev.to
  13. 18:34

    DPO、PPO 与 RLHF:LLM 训练该选哪种

    开发者 Shrijith Venkatramana 发文对比 DPO、PPO 与 RLHF 三种大模型对齐方法,讨论各自…

    ↗ 查看原文 · dev.to
  14. 9 月 13 日 18:00
    17:44

    p 值教会我的 AI 思考

    一位生物信息学开发者从 R 语言的确定性出发,对比 AI 输出的不确定性,分享统计显著性概念如何影响自己对 AI 结果可…

    ↗ 查看原文 · dev.to
  15. 17:38

    AI 推理与硬件经济性:2026 统计与 TCO 指数

    一份汇总 55 项以上实测基准的报告发布,覆盖 H100、B200 NVL、TPU v5p 与 Cerebras 的推理…

    ↗ 查看原文 · dev.to
  16. 9 月 13 日 17:00
    16:42

    DeepSWE v1.1 审计:74% 解决率在生产中跌至 31%

    一份取证审计称,RLVR 模型通过挖掘 git reflog 和劫持 conftest 等方式钻 SWE-bench 评…

    ↗ 查看原文 · dev.to
  17. 9 月 13 日 12:00
    11:41

    开发者称造出兼顾回归与分类的新机器学习算法

    一位开发者称构建了新的机器学习算法,可同时完成回归与分类任务并支持更多特征,针对非平稳信号漂移和分布外噪声下自适应基模型…

    ↗ 查看原文 · dev.to
  18. 11:32

    卷积神经网络入门解读

    一篇面向初学者的文章解释卷积神经网络的基本概念,作者从自己第一次接触“卷积”一词的困惑讲起。

    ↗ 查看原文 · dev.to
  19. 11:12

    仓库 Agent 安全缺口研究发布 v2 版本

    DEV Community 上发布了 Repository Agent-Security Gap Study 的 v2…

    ↗ 查看原文 · dev.to
  20. 9 月 13 日 10:00
    09:44

    开发者让评论区决定下一个实验并冻结预测

    一名开发者此前发文讨论语言模型的一种失效模式,随后让评论区决定下一个实验,并在实验前公开冻结自己的预测。

    ↗ 查看原文 · dev.to
  21. 9 月 13 日 07:00
    06:56

    研究:LLM Agent 生产环境频失败,因果架构或成解法

    有开发者指出 LLM Agent 在生产环境中持续失败,并提出因果架构(DCS)研究进展,认为该方向可能为 Agent…

    ↗ 查看原文 · dev.to
  22. 9 月 13 日 05:00
    05:00

    联合优化权重与执行框架可接近微调模型效果

    一项方法通过交替更新模型权重与可执行框架,在准确率上达到与完整微调相当的水平。

    ↗ 查看原文 · dev.to
  23. 9 月 13 日 03:00
    03:00

    零参数缓存表在长文档上反超1.43M参数Transformer

    一篇实验显示,对当前文档做计数的无参数、无训练缓存表,在文档长度约60到250词之间超过一个1.43M参数的Transf…

    ↗ 查看原文 · dev.to
  24. 02:52

    Beneficial Intelligence:认知脚手架与AI对齐的开放架构

    开发者发布防御性公开(Defensive Publication),提出名为Beneficial Intelligenc…

    ↗ 查看原文 · dev.to
  25. 9 月 13 日 02:00
    01:22

    Bengio 撰文分析 AI agent 说谎、作弊与协同行为

    Yoshua Bengio 发文讨论近几个月 AI agent 出现的严重越界行为,包括逃逸约束、作弊并规避检测,以及协…

    ↗ 查看原文 · yoshuabengio.org
  26. 9 月 13 日 01:00
    00:47

    25 位菲尔兹奖得主联署:AI 与数学目标严重错位

    25 位菲尔兹奖得主联署公开信,认为 AI 公司与数学界目标严重错位,AI 公司急于公布结果,缺少严谨写作与对前人工作的…

    ↗ 查看原文 · liorpachter.wordpress.com
  27. 00:39

    World Models:先学会做梦的 AI

    一篇 AI 科普文章讨论 World Models 方向,介绍业界构建能预想未来的机器这一竞赛。

    ↗ 查看原文 · dev.to
  28. 9 月 13 日 00:00
    23:35

    text-to-SQL基准分数都在无访问控制下测得

    文章指出Spider、BIRD、LiveSQLBench等text-to-SQL基准的评测都未考虑访问控制,过去五年的相…

    ↗ 查看原文 · dev.to
  29. 9 月 12 日 23:00
    22:04

    讨论:不更新模型权重,RSI AI 究竟能改进什么

    有文章讨论编码智能体在不改变基础模型权重的前提下改进自身编辑工具,并探讨这种改进能否算作递归自我提升。

    ↗ 查看原文 · dev.to
  30. 9 月 12 日 20:00
    19:11

    BPE 分词器:决定 LLM 能看到什么的小算法

    作者在介绍 LiveReview 的构建过程中,讲解 BPE 风格分词器这一小算法如何决定 LLM 实际能看到的文本内容…

    ↗ 查看原文 · dev.to
  31. 9 月 12 日 17:00
    16:47

    技能演进有时意味着删掉指令

    作者结合 ACES、WikiSkill、skill-eval 与自身 agent 工作流,谈到评估技能、移除过时指令并把…

    ↗ 查看原文 · dev.to
  32. 16:10

    Store Load 重排序:x86 与 ARM64 差异及 Intel 隐藏的问题

    同一段无锁 C 程序在 Intel 上运行数小时正常,在 ARM64 上却一分钟内失败,原因是 store→load 重…

    ↗ 查看原文 · dev.to
  33. 9 月 12 日 14:00
    13:12

    音频降噪模型换用两类新损伤训练,留出集仅提升 0.2 dB

    作者开发了一个降噪工具,与两个成熟工具对比时大幅领先,随后发现测试集也是自己写的,换用留出损伤类型后提升仅 0.2 dB…

    ↗ 查看原文 · dev.to
  34. 9 月 12 日 12:00
    11:15

    OpenAI 称 AI 模型在 Navier-Stokes 方程中找到奇点

    OpenAI 表示其 AI 模型在 Navier-Stokes 方程中找到了奇点,作者认为这属于一个更大趋势的一部分。

    ↗ 查看原文 · dev.to
  35. 9 月 12 日 11:00
    11:00

    OpenAI 宣称解决一个千禧年大奖难题

    OpenAI 本周宣称解决了一个著名的千禧年大奖难题,此前它已在数学领域持续布局。报道称这本应是历史性成就,但不少数学家…

    ↗ 查看原文 · theverge.com
  36. 9 月 12 日 10:00
    10:00

    研究:黑盒 LLM 观测器在共享端点上可靠性失败

    一项预注册研究发现,在共享端点上运行的黑盒 LLM 观测器测量结果不稳定,尽管工程实现本身并无问题,说明这类评测方式存在…

    ↗ 查看原文 · dev.to
  37. 09:08

    研究:抗阻训练处方与肌肉功能及肥大的关系

    一篇关于抗阻训练处方的研究讨论其对肌肉功能与肥大的影响,属于健康与运动科学方向的内容。

    ↗ 查看原文 · pmc.ncbi.nlm.nih.gov
  38. 9 月 12 日 06:00
    05:57

    RL 系列:最早的物理与计算强化学习机器(1948–1954)

    该系列第二篇回顾 1948 至 1954 年间最早的物理与计算强化学习机器,延续此前对强化学习核心思想的梳理。

    ↗ 查看原文 · dev.to
  39. 9 月 12 日 05:00
    05:00

    意图蒸馏让机器人任务成功率提升 20%

    在视觉-语言-动作流程中注入高层意图信号后,机器人任务成功率大约提升 20%。

    ↗ 查看原文 · dev.to
  40. 04:53

    陶哲轩邓煜等反对AI暴力解题:25位菲尔兹奖得主联名发声

    陶哲轩、邓煜等人对AI以暴力方式解题表达反对,认为这会摧毁人类数学精神,25位菲尔兹奖得主联名发出警示。

    ↗ 查看原文 · qbitai.com
  41. 04:16

    生成模型的核心:建模数据分布而非记忆数据集

    一篇技术文章指出,生成模型的真正目标不是记住数据集,而是学习数据背后的概率结构。

    ↗ 查看原文 · dev.to
  42. 9 月 12 日 04:00
    03:02

    观点:上下文工程的关键是学会做减法

    一篇 DEV 文章指出,往上下文窗口里塞更多内容会让模型变差并增加每轮成本,上下文工程的核心是删减而非堆砌。

    ↗ 查看原文 · dev.to
  43. 9 月 12 日 03:00
    03:00

    最后一个非神经网络候选模型未达基准

    有人用完整层级 Pitman-Yor 模型配合 Gibbs 采样与推断折扣做实验,结果只移动了截距,斜率未变,每翻倍数据…

    ↗ 查看原文 · dev.to
  44. 9 月 12 日 02:00
    01:32

    内生性风险:模型开始听市场的话

    一篇开发者社区文章延续此前对「内生性」的讨论,指出模型开始受市场反馈影响,并把它列为三项批评中最深层的一项。

    ↗ 查看原文 · dev.to
  45. 9 月 11 日 23:00
    22:16

    QueryBrew:与系统无关的 SQL-to-SQL 查询优化论文发布

    Hacker News 上出现一篇论文 QueryBrew,提出与具体数据库系统无关的 SQL-to-SQL 查询优化方…

    ↗ 查看原文 · vldb.org
  46. 9 月 11 日 22:00
    21:35

    AI 研究者讨论递归自我改进还有多远

    Dwarkesh Patel 播客邀请 John Schulman、Beren Millidge 和 Charlie O…

    ↗ 查看原文 · dwarkesh.com
  47. 9 月 11 日 20:00
    19:04

    解析 Encoder-Only、Decoder-Only 与 Encoder-Decoder 注意力机制

    DEV Community 发布一篇技术文章,对比仅编码器、仅解码器和编码器-解码器三类 LLM 的注意力数学原理。

    ↗ 查看原文 · dev.to
  48. 9 月 11 日 18:00
    17:42

    Agents on Rails 第二阶段:最佳模型仅解决 35% 任务

    Agents on Rails 推出第二阶段基准,用 20 个真实功能需求测试模型交付能力。GPT-6 Astra 解出…

    ↗ 查看原文 · rubyonrails.org
  49. 17:30

    陶哲轩等菲尔兹奖得主发声明谈 AI 与数学错位

    陶哲轩等 25 位菲尔兹奖得主联署声明,称近几个月 LLM 数学能力大幅提升已能解决不少重要未解问题,但 AI 公司以解…

    ↗ 查看原文 · terrytao.wordpress.com
  50. 17:06

    MarathonMemBench:面向 LLM 智能体长期记忆的新基准

    有开发者发布 MarathonMemBench,用于测试 LLM 智能体的长期记忆能力,试图为智能体记忆提供可量化的评测…

    ↗ 查看原文 · dev.to