跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 16 日 12:00
    11:26

    上下文窗口变大的隐性代价:向量数据库逼近极限

    随着 LLM 上下文突破百万 token 量级,向量检索的取舍正在改变。文章分析了向量数据库在这一趋势下面临的局限。

    ↗ 查看原文 · dev.to
  2. 9 月 16 日 11:00
    11:00

    BM25 算法解析:现代搜索背后的机制

    一篇技术文章讲解 BM25 算法,承接此前关于 TF-IDF 的介绍,说明文本如何被转换为可检索的数值表示。

    ↗ 查看原文 · dev.to
  3. 10:27

    WetRobo:面向生物实验室的可复现机器人套件

    研究者构建 WetRobo 机器人套件,包含机械臂、实验室器材、遥操作演示与 AGENTS.md 技能文件,让编码智能体…

    ↗ 查看原文 · arxiv.org
  4. 9 月 16 日 10:00
    09:12

    LLM 时代如何学习编程

    Mark Seemann 公开回复一位读者来信,讨论 LLM 时代的学习与能力问题。

    ↗ 查看原文 · blog.ploeh.dk
  5. 9 月 16 日 09:00
    08:41

    离线同策略蒸馏:用可学习性信号处理不完美教师

    研究者提出轨迹可学习性方法,利用教师成功题目作为参照,衡量教师失败轨迹中各 token 似然的变化并加权蒸馏损失。

    ↗ 查看原文 · arxiv.org
  6. 08:36

    Graph-RAG 与标准 RAG 在文化类问答上的对比研究

    研究在 LatamQA 文化多选题数据集上对比 Graph-RAG 与标准 RAG,图谱由 Wikipedia 文章经…

    ↗ 查看原文 · arxiv.org
  7. 08:32

    研究:提示词自然语言差异影响 LLM 代码生成

    研究用 7 个模型在 AtCoder、LeetCode、BigCodeBench 上测试英文、日文、中文提示对代码生成准…

    ↗ 查看原文 · arxiv.org
  8. 9 月 16 日 07:00
    06:13

    WFM:面向复杂智能体推理的 Wiki 基础模型

    研究提出 Wiki Foundation Model(WFM),用 Wiki Graph 模式连接细粒度结构与稠密上下文…

    ↗ 查看原文 · arxiv.org
  9. 9 月 16 日 06:00
    05:24

    2026推测解码工程指南:从EAGLE到DFlash到XPress

    一篇工程向文章梳理2026年推测解码技术路线,覆盖EAGLE、DFlash与XPress等方案。

    ↗ 查看原文 · dev.to
  10. 05:23

    LLM知识-推理权衡:2026年最强模型刻意减少事实记忆

    文章讨论2026年顶尖模型刻意压缩事实性知识、换取更快推理速度的趋势,并分析这一知识-推理权衡背后的原因。

    ↗ 查看原文 · dev.to
  11. 05:05

    ContrAgent:用契约对 LLM 智能体做符号化时序监督

    研究提出 ContrAgent,将智能体工具调用序列形式化为可检查谓词轨迹,并用 LTLf 假设-保证契约编译成确定性有…

    ↗ 查看原文 · arxiv.org
  12. 9 月 16 日 05:00
    04:08

    EffiRAG:图结构RAG成本降57%,答案质量仍占优

    研究者提出图结构RAG系统EffiRAG,用图定位相关段落、由原文生成答案,在UltraDomain的120个问题上93…

    ↗ 查看原文 · arxiv.org
  13. 9 月 16 日 04:00
    04:00

    Agora:用Git做多智能体共享研究记忆

    Agora把研究过程记录为存于Git的只追加DAG,每条结论都是可复现的提交。13个模型worker无中心调度运行近12…

    ↗ 查看原文 · arxiv.org
  14. 03:07

    研究:把记忆交给CPU,大模型推理会变快

    有研究提出将大模型的记忆部分放到CPU上处理,让GPU专注生成Token,从而提升推理速度。

    ↗ 查看原文 · qbitai.com
  15. 9 月 16 日 03:00
    02:55

    低成本LLM写企业代码:结构合规但正确率仅12.9%

    研究让Gemini Flash 3、GPT-5.4 mini和Claude Haiku 4.5按规格生成Java Spr…

    ↗ 查看原文 · arxiv.org
  16. 9 月 16 日 02:00
    01:21

    角色设定会让LLM推荐助手偏向赞助内容

    研究发现,当系统提示把平台而非消费者设为AI代理的委托方时,代理对赞助列表的惩罚明显减弱,披露标签引发的怀疑也随之降低…

    ↗ 查看原文 · arxiv.org
  17. 01:15

    RideWay:用效率指标评测工具调用智能体

    新基准RideWay针对网约车场景,提出成功门控的Efficiency Utility指标,按多余工具调用和对话轮次扣分…

    ↗ 查看原文 · arxiv.org
  18. 01:14

    TuiML:为 AI Agent 设计的机器学习库开源

    arXiv 论文提出 TuiML,一个面向 AI Agent 的机器学习库,组件带机器可读元数据与参数模式,调用可校验…

    ↗ 查看原文 · arxiv.org
  19. 01:13

    论文:文档编辑后 KV 缓存按预算修复

    arXiv 论文研究文档编辑后过期 KV 缓存的预算化重算修复,在事实性 RAG 基准上比较多种免训练位置选择策略。结果…

    ↗ 查看原文 · arxiv.org
  20. 9 月 16 日 00:00
    23:40

    论文:定位隐藏失败可提升长程 Agent 可靠性

    arXiv 论文分析 2518 条 Agent 轨迹,将 6967 个错误归为 78 种失败类型,发现 Agent 首次…

    ↗ 查看原文 · arxiv.org
  21. 23:22

    开发者吐槽AI生成Java代码中的布尔switch写法

    一名开发者在阅读AI生成的Java代码时,遇到一种不常见的布尔值switch写法,并撰文分析该写法的问题。

    ↗ 查看原文 · dev.to
  22. 9 月 15 日 21:00
    20:32

    论文:投毒基准可让自进化编程智能体写出漏洞代码

    研究者把 Thompson 的「信任信任」攻击搬到自修改编程智能体上,用被污染的基准影响其自评与自改进过程。

    ↗ 查看原文 · arxiv.org
  23. 9 月 15 日 20:00
    19:07

    研究:RL 后训练中难样本几乎不提升,提出 Never Give Up 方法

    一篇博客介绍其 RL 后训练论文,指出 AIME 评测中简单题大幅提升、初始 pass@32 为 0 的难题几乎无改善…

    ↗ 查看原文 · mnoukhov.github.io
  24. 9 月 15 日 19:00
    18:34

    循环 Transformer RLT:让模型不必遗忘上下文

    DEV 社区文章介绍 Recurrent Looped Transformer(RLT),探讨 Transformer…

    ↗ 查看原文 · dev.to
  25. 18:20

    论文提出 DRAG:按查询动态选择 RAG 检索器与生成器

    研究系统分析了检索器与生成器复杂度在事实型和多跳问答中的交互,发现更强检索收益更大但存在递减与非单调回报。

    ↗ 查看原文 · arxiv.org
  26. 18:10

    大规模实证研究:157 个开源智能体项目质量保障存在缺口

    研究分析了 157 个 GitHub 星标过百的开源 LLM 智能体项目,考察其文档、代码、配置与测试。

    ↗ 查看原文 · arxiv.org
  27. 9 月 15 日 18:00
    17:57

    论文提出 agentic society 需要「社会 harness」

    arXiv 论文指出,在跨信任边界的多智能体协作中,即使诚实且能力足够的智能体也常因现有通信机制而失败,恶意智能体还可利…

    ↗ 查看原文 · arxiv.org
  28. 17:37

    HN 讨论:Navier-Stokes 之后仍看空 LLM

    Hacker News 上出现一篇长文,作者称即便模型在 Navier-Stokes 等任务上有所表现,他仍对 LLM…

    ↗ 查看原文 · dank.systems
  29. 9 月 15 日 17:00
    16:53

    Fathom:面向卸载 KV 缓存的按查询读取深度稀疏解码

    针对百万 token 智能体会话中 KV 缓存索引扫描成为解码瓶颈的问题,Fathom 让每个查询自行决定读取每个 ke…

    ↗ 查看原文 · arxiv.org
  30. 16:29

    开发者基准测试九种本地VLM流水线处理手写临床表单

    有开发者对九种本地VLM流水线配置在手写临床表单上做了基准测试,并公开了失败的实验。

    ↗ 查看原文 · dev.to
  31. 16:29

    研究称 SWE-bench 榜单已无法区分头部编码智能体

    一项对 254 份 SWE-bench 提交的审计发现,Verified 分榜前两名各解决 500 题中的 396 题…

    ↗ 查看原文 · arxiv.org
  32. 16:27

    FlashVector:跨层优化模型服务栈的智能体系统

    论文提出 FlashVector,把单 GPU 内核优化智能体扩展到框架计算图、模型服务器和特征处理等异构层。

    ↗ 查看原文 · arxiv.org
  33. 9 月 15 日 16:00
    16:00

    IBM 研究:Agent 单次成功不代表可重复,一致性存在明显缺口

    IBM 研究指出,多数基准用平均值掩盖了 Agent 的波动性。

    ↗ 查看原文 · huggingface.co
  34. 9 月 15 日 15:00
    14:50

    研究复盘 OpenClaw 技能生态爆发后的治理难题

    论文基于 OpenClaw 的 Git 历史与三份 ClawHub 快照,发现技能库 91 天内近乎翻倍,但 77.86…

    ↗ 查看原文 · arxiv.org
  35. 14:40

    OpenShell 分享用形式化方法管控 AI Agent 的经验

    OpenShell 团队撰文介绍如何用 Z3 开源库对 Agent 提出的权限变更做形式化证明,确保其不超出已批准的策略…

    ↗ 查看原文 · nvidia.github.io
  36. 14:31

    GRP-Obliteration:单条无标注提示即可解除 LLM 对齐

    微软等机构研究者提出 GRP-Obliteration,用 GRPO 直接移除模型安全约束,单条无标注提示即可稳定解除对…

    ↗ 查看原文 · arxiv.org
  37. 9 月 15 日 14:00
    13:41

    近五千名数学家联署:AI 正在破坏专业能力的判断标准

    近五千名数学家(含25位菲尔兹奖得主)签署声明《AI 在数学中的严重错位》,认为 AI 解题只是手段,概念理解才是目标…

    ↗ 查看原文 · seangoedecke.com
  38. 13:05

    Transformer 位置嵌入原理讲解视频发布

    一篇 DEV 文章配合 7 分钟视频,讲解 Transformer 中位置嵌入、残差连接与层的作用。

    ↗ 查看原文 · dev.to
  39. 9 月 15 日 13:00
    12:48

    GPT-6 Astra 参与 2D CFET 热电协同设计

    论文用 AI 智能体工作流在给定热电模型内研究 2D CFET 逆变器热设计,Astra 选出重分布源极互连结构,配合协…

    ↗ 查看原文 · arxiv.org
  40. 12:32

    实测 120 个 AI 生成函数:未发现静默吞错

    有人用 Semgrep 检测器加人工判定,检查本地生成的 120 个 Python/TypeScript 函数,所有被标…

    ↗ 查看原文 · dev.to
  41. 9 月 15 日 12:00
    11:23

    ORDER:按查询动态调整 RAG 索引与检索

    研究者提出 ORDER 框架,先对语料相关问题聚类,为每类学习分块、元数据过滤与重排配置,推理时按最近质心路由查询,并用…

    ↗ 查看原文 · arxiv.org
  42. 9 月 15 日 11:00
    10:11

    RepoAtlas:用演化式多模态仓库视图辅助编码智能体

    RepoAtlas 是一个免训练模块,通过选择—投影—刷新循环在仓库代码图上维护动态多模态视图。

    ↗ 查看原文 · arxiv.org
  43. 9 月 15 日 09:00
    08:50

    文章:用思维模型理解神经网络

    一篇 DEV Community 文章分享作者如何从机械式理解转向借助思维模型来学习神经网络。

    ↗ 查看原文 · dev.to
  44. 08:39

    如何把神经网络得分归一化为概率分布

    文章讲解神经网络输出的实值得分并非天然是概率,需要经过归一化处理才能转化为概率分布。

    ↗ 查看原文 · dev.to
  45. 9 月 15 日 07:00
    06:37

    Meta 提出字节级蒸馏,下游准确率上限高 4 个百分点

    Meta FAIR 与华盛顿大学论文提出把蒸馏的学习单位从 Token 换成 Byte,并给出 Marginalize-…

    ↗ 查看原文 · qbitai.com
  46. 06:31

    LLM 数学差并非能力问题,而是它本就没在做数学

    有文章指出,大模型在数学任务上的表现不佳,根源在于它并非真正执行计算,而是在做模式匹配。这一视角影响对模型能力边界的判断…

    ↗ 查看原文 · dev.to
  47. 06:01

    little m:面向工业过程优化的 AI 智能体

    研究者提出智能体 little m,结合领域知识库与 LLM 交互,把自然语言和工艺图转化为数学优化模型,并发布含 50…

    ↗ 查看原文 · arxiv.org
  48. 9 月 15 日 05:00
    05:00

    Steering vectors 让 LLM 对齐人类价值观

    一项讨论指出,从大模型激活分布中提取的线性方向可对应人类价值取向,可用于引导模型行为。这为模型对齐提供了一种基于激活层面…

    ↗ 查看原文 · dev.to
  49. 04:38

    AURA:面向生产推荐系统的智能体诊断与改进

    AURA 是一套端到端智能体系统,可读取生产互动日志,规模化定性评估推荐质量并定位失败模式,再结合代码与训练管线提出并实…

    ↗ 查看原文 · arxiv.org
  50. 9 月 15 日 04:00
    03:58

    ExecuCritic:用执行反馈联合训练代码模型与评审器

    研究者提出 ExecuCritic,让代码模型与评审器在同一批执行轨迹上联合训练,评审器预测通过与否并给出简短诊断反馈…

    ↗ 查看原文 · arxiv.org