跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 26 日 10:00
    09:41

    Haskell 社区讨论:在 LLM 时代如何保持编程乐趣

    Haskell 社区论坛出现一篇讨论帖,作者谈到对 AI 倦怠、被低技能者取代的担忧以及项目代码质量下降,并提出在 LL…

    ↗ 查看原文 · discourse.haskell.org
  2. 09:07

    FSD 级团队发布 Physical AI 首版模型 Simate-beta

    该团队发布首版 Physical AI 模型 Simate-beta,训练、推理与评测全流程接入自研 Infra,可并行…

    ↗ 查看原文 · qbitai.com
  3. 9 月 26 日 05:00
    05:00

    锚点让记忆保留率提升约 28 倍

    在持续学习场景中引入锚点后,100 项任务的记忆保留率从约 1% 提升到约 35%。

    ↗ 查看原文 · dev.to
  4. 04:42

    文章:让 AI 记住比让它更聪明更难也更有价值

    DEV Community 刊文讨论 AI 记忆能力,认为让模型记住信息的难度和价值都高于单纯提升智能水平。

    ↗ 查看原文 · dev.to
  5. 9 月 26 日 03:00
    02:17

    Claude Code 自动记忆单行事实可影响后续会话

    测试显示,存入 Claude Code 自动记忆的一行事实在 4 次全新会话中有 3 次首次尝试即被应用,而两种方式都不…

    ↗ 查看原文 · dev.to
  6. 9 月 25 日 23:00
    22:50

    多奖励强化学习对比:PPO、GRPO、DAPO 与 GDPO

    一篇技术文章对比了 GDPO 与 GRPO、DAPO、PPO 在多奖励 LLM Agent 后训练中的表现,涉及归一化数…

    ↗ 查看原文 · dev.to
  7. 9 月 25 日 21:00
    20:59

    开发者构建说谎基准测试LLM工具调用

    一名开发者为Kaggle基准测试挑战赛构建了一个会说谎的基准,用于检验LLM是否会真正核实其调用的工具。

    ↗ 查看原文 · dev.to
  8. 20:35

    测试题写错后,多数模型选择顺从测试

    有开发者在 Kaggle 基准测试挑战中故意放入一个错误测试,结果多数模型选择与测试保持一致,而非指出错误。

    ↗ 查看原文 · dev.to
  9. 9 月 25 日 20:00
    19:36

    基础梯度下降优化算法概览

    文章梳理了梯度下降这一无约束数学优化方法的基本原理,属于一阶优化算法范畴。

    ↗ 查看原文 · dev.to
  10. 9 月 25 日 19:00
    18:37

    Alan Kay 谈香农:为处理噪声信道提供方法

    Hacker News 上分享了一段视频,Alan Kay 讲述香农如何为处理有噪声的信道提供了一套方法。

    ↗ 查看原文 · youtube.com
  11. 9 月 25 日 17:00
    16:24

    研究:多 Agent 辩论改善的是解释而非决策

    一篇 DEV 文章指出,当自主 Agent 做出错误判断时,常见的架构应对是引入多 Agent 辩论,但辩论提升的是解释…

    ↗ 查看原文 · dev.to
  12. 16:14

    新基准测试考察 AI 的信念归因能力

    有开发者提交 Kaggle Benchmarking Challenge 作品,提出一个用于评估 AI 信念归因的基准…

    ↗ 查看原文 · dev.to
  13. 9 月 25 日 16:00
    15:33

    五个代理作弊我的基准,找出三个漏洞

    作者发布了一个强化学习环境,用五个代理尝试作弊自己的基准测试,结果发现三个漏洞,随后又有三个漏洞被其他代理发现。

    ↗ 查看原文 · dev.to
  14. 15:29

    RL 4:早期启发式与时间差分学习的诞生(1959–1968)

    一篇回顾强化学习早期历史的文章梳理了1959至1968年间从贝尔曼方程到时间差分学习雏形的演进,指出当时计算机算力不足…

    ↗ 查看原文 · dev.to
  15. 9 月 25 日 14:00
    13:24

    Skild AI 用自我对弈训练人形机器人 Messinator 踢足球

    Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,仅以进球为奖励,最终…

    ↗ 查看原文 · qbitai.com
  16. 9 月 25 日 13:00
    13:00

    科普文章:注意力机制是学出来的加权平均,代价在平方项

    一篇 ML 系列文章解释注意力机制本质上是学习得到的加权平均,并指出其计算成本来自平方级复杂度。

    ↗ 查看原文 · dev.to
  17. 12:49

    推理越多反而越差,多模型协作或更优

    文章指出更多推理并不总能带来更好答案,并分享了一个过度推理的真实案例,讨论模型多样性以及快慢 AI 系统配合使用的可能性…

    ↗ 查看原文 · dev.to
  18. 9 月 25 日 10:00
    09:18

    两轮评分系统:上下文如何改变评分结果

    一篇技术文章讨论两轮评分机制,说明评分所处的上下文会如何影响最终得分。

    ↗ 查看原文 · dev.to
  19. 09:03

    AI 能否先于人类识别市场危机

    有文章讨论 AI 如何学习识别金融压力出现前的隐藏信号,尝试在人类之前发现市场危机迹象。

    ↗ 查看原文 · dev.to
  20. 9 月 25 日 08:00
    07:57

    复现实验:只信单一分数的停止规则不如固定预算

    一篇现场笔记复现了已发表的 agent 循环基准测试,并指出该基准可能掩盖的问题。作者认为依赖单一评分决定何时停止,效果…

    ↗ 查看原文 · dev.to
  21. 07:27

    Kaggle 基准测试:文档缺页时模型会编造总数

    一项 Kaggle 基准测试发现,当包含答案的页面缺失时,约半数模型会给出文档中并未出现的合计数字。

    ↗ 查看原文 · dev.to
  22. 9 月 25 日 06:00
    05:53

    编译器、解释器与 JIT:代码执行时究竟发生了什么

    一篇技术文章深入讲解编译器、解释器和 JIT 引擎执行代码时,CPU 寄存器、内存与运行时调度循环中的实际过程。

    ↗ 查看原文 · dev.to
  23. 05:30

    DEV社区科普:Bagging如何提升机器学习模型稳健性

    DEV社区发布文章介绍Bootstrap聚合与Bagging方法,讲解其如何通过组合多个训练数据排列下的模型结果,提升机…

    ↗ 查看原文 · dev.to
  24. 9 月 25 日 05:00
    05:00

    Grouped Value Attention将KV缓存削减约45%

    有开发者提出Grouped Value Attention方法,可将Transformer的KV缓存内存削减约45%,且…

    ↗ 查看原文 · dev.to
  25. 04:29

    系列文章探讨多 AI Agent 协同为何最难驾驭

    DEV Community 发布 AI Harness Engineering 系列第八篇随笔,讨论一群 AI Agen…

    ↗ 查看原文 · dev.to
  26. 9 月 24 日 22:00
    21:52

    SFT 与 RL 在模型内部改动了什么

    一篇科普文章对比 SFT、RLVR 与权重谱,指出微调会重写奇异值,而强化学习保留奇异值、只旋转其周围的框架。

    ↗ 查看原文 · dev.to
  27. 9 月 24 日 21:00
    20:52

    Harness Engineering 101:编码智能体如何工作

    DEV Community 发文介绍编码智能体的 harness 概念,指出同一模型在不同 harness 下分别完成…

    ↗ 查看原文 · dev.to
  28. 9 月 24 日 20:00
    19:39

    35B 模型与类型化决策模型在 12000 条真实询价单上对比

    测试对比了类型化决策 API 与一个 35B 模型在 12000 条真实 RFQ 上的表现,主类别准确率分别为 91.9…

    ↗ 查看原文 · dev.to
  29. 19:15

    421M 参数决策模型在 NVIDIA GPU 上的跑分

    作者在单张 H100 NVL 上对 421M 参数的决策模型 Laya 做基准测试,称每天可完成 1510 万次决策。

    ↗ 查看原文 · dev.to
  30. 19:14

    研究者用 LLM 追踪炼金术知识并解读 17 世纪信件

    有历史学者撰文称,借助本周发布的 GPT-6 Sol 与 Opus 5.5,可尝试解决转录之外的历史研究问题,并建议 A…

    ↗ 查看原文 · resobscura.substack.com
  31. 9 月 24 日 19:00
    18:24

    研究发现肌酸摄取可增强抗肿瘤免疫

    一项研究显示肌酸摄取能够增强抗肿瘤免疫反应,具体机制与实验细节在来源中未展开。

    ↗ 查看原文 · cell.com
  32. 9 月 24 日 18:00
    17:58

    RAPID:从单次人类演示生成机器人程序

    研究者提出 RAPID,只需一段视觉人类演示,就能自动生成、验证并迭代优化机器人程序。

    ↗ 查看原文 · arxiv.org
  33. 17:53

    论文:编码智能体可自动求解广义 TAMP 问题

    研究测试编码智能体能否自动合成可跨实例泛化的程序,以替代 TAMP 领域的专门工程。

    ↗ 查看原文 · arxiv.org
  34. 17:46

    MISVO:用 KL 几何约束语言模型干预

    研究者提出 MISVO,在冻结语言模型的最终隐藏状态上做最小侵入式引导向量优化,用局部 KL 几何惩罚干预以抑制分布偏移…

    ↗ 查看原文 · arxiv.org
  35. 17:26

    百万级智能体是分布式系统问题

    一篇工程文章认为,智能体受限于 token、上下文、算力与成本,应像进程一样被调度和恢复,持久化的应是状态而非智能体本身…

    ↗ 查看原文 · instacloud.com
  36. 17:13

    加固 LLM-as-judge 以抵御提示注入

    文章讨论 LLM 评审的一个固有风险:它要打分的输出本身不可完全信任,并给出针对提示注入的加固思路。

    ↗ 查看原文 · dev.to
  37. 9 月 24 日 17:00
    16:56

    研究评估编码代理的版本迁移技能效果

    一项回顾性研究用64份报告、16个静态迁移任务检验插件升级技能,启用后平均奖励从93.83升至98.75,但增益集中在一…

    ↗ 查看原文 · arxiv.org
  38. 16:25

    观点:Agent 世界模型应编辑对话记录而非模拟终端

    一篇 DEV 社区文章指出,语言 Agent 的世界模型讨论多直接照搬机器人领域假设,作者主张这类模型应改为编辑对话记录…

    ↗ 查看原文 · dev.to
  39. 16:12

    SciWalker 用算子图合成科学编程题

    研究者提出 SciWalker 框架,通过算子链采样与执行反馈合成科学编程问题,构建了覆盖5个领域、32个子域的8178…

    ↗ 查看原文 · arxiv.org
  40. 16:10

    实测:LSB 隐写在聊天应用中会被彻底破坏

    作者对比 LSB 与鲁棒水印,将 LSB 隐写图片经模拟 WhatsApp 传输后,误码率达 49%,相当于信息完全丢失…

    ↗ 查看原文 · dev.to
  41. 9 月 24 日 16:00
    15:51

    低成本测试套件追踪跨厂商模型行为

    研究者提出一套低成本、可复现的模型行为测试方法,在跨厂商模型面板上运行固定刺激,发现44个模型中有27个在四次尝试中至少…

    ↗ 查看原文 · arxiv.org
  42. 15:48

    领域适配 RAG 用于金融合规问答

    研究在 LegalBERT 上分三阶段构建检索器并配合小模型生成,在 ObliQA 基准上 Recall@10 从0.2…

    ↗ 查看原文 · arxiv.org
  43. 15:08

    用更少 token 实现 ACE 的 agent 经验复用方案

    有开发者提出一种思路,让 ACE 与 ALTK-Evolve 这类把 agent 轨迹转成可复用经验的方法在更少 tok…

    ↗ 查看原文 · dev.to
  44. 15:05

    AI 能否在不加剧故障的前提下诊断 Linux 生产事故?

    一篇 Kaggle 基准测试挑战投稿,作者对 AI 诊断 Linux 生产事故的能力进行基准测试,关注是否会引入新的问题…

    ↗ 查看原文 · dev.to
  45. 9 月 24 日 15:00
    14:44

    研究:AI 代理队友冲击企业协作生态

    一项在一家大型科技公司多团队开展的实地定性研究显示,持续主动的 AI 代理队友与人类协作的隐性规则、关系边界和信任分配产…

    ↗ 查看原文 · arxiv.org
  46. 9 月 24 日 14:00
    13:40

    华为提出 KV Cache 新解法应对显存压力

    面对显存不足、内存成本高企和 KV Cache 不断增大的问题,华为给出了自己的新解法。

    ↗ 查看原文 · infoq.cn
  47. 13:17

    Env-Rethink:让 LLM Agent 环境自我演化以提升表现

    研究者提出 Env-Rethink,用 27B 后训练模型为 Agent 构建文件收集图与事件日志、识别环境噪声,并通过…

    ↗ 查看原文 · arxiv.org
  48. 13:06

    基准测试显示小模型能识别陷阱却仍会踩进去

    一项 Kaggle 基准测试挑战的提交显示,小型 AI 模型能够识别出任务中的陷阱,但最终仍会做出错误选择。原文未给出具…

    ↗ 查看原文 · dev.to
  49. 9 月 24 日 13:00
    13:00

    评测集可能循环:模型表现差未必是模型的问题

    作者用规则检测器和微调模型做对比实验,说明评测集本身存在循环偏差时,会误判模型能力。

    ↗ 查看原文 · dev.to
  50. 13:00

    观点:张量形状是 ML 的类型系统,却没人替你检查

    一篇 ML 系列文章指出,张量形状在机器学习中扮演类型系统的角色,但实践中缺少自动检查,容易埋下隐患。

    ↗ 查看原文 · dev.to