跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 7 日 10:00
    09:38

    Matryoshka哈希表示实现紧凑语义检索

    新方法MHR分两阶段训练,先学习长二进制码,再冻结模型添加残差适配器,使短前缀可直接搜索。在MS MARCO和BEIR基…

    ↗ 查看原文 · arxiv.org
  2. 9 月 7 日 09:00
    08:36

    菲尔兹奖得主参与大模型,4B手机Qwen与云端GLM刷爆ARC-AGI 3

    菲尔兹奖得主加入大模型研发,4B参数的手机端Qwen模型与云端GLM模型在ARC-AGI 3基准上表现突出,但指出两模型…

    ↗ 查看原文 · qbitai.com
  3. 9 月 7 日 07:00
    06:32

    MemLoc框架提升长期对话记忆问答能力

    新框架MemLoc采用检索-定位-生成流程,通过多粒度记忆单元和跨会话图建模,结合推理式证据定位器,有效处理碎片化证据和…

    ↗ 查看原文 · arxiv.org
  4. 06:03

    层级一致性框架审计RAG系统证据冲突

    新框架HCF从知识库、检索上下文和生成答案三个层级审计RAG系统,能识别答案正确但上下文矛盾的情况,使证据可追溯。

    ↗ 查看原文 · arxiv.org
  5. 9 月 7 日 06:00
    05:13

    对比证据探索提升多跳检索质量

    新提出的免训练多跳检索框架,通过证据条件探索和对比细化,在多个基准上持续提升检索质量和下游问答性能。

    ↗ 查看原文 · arxiv.org
  6. 9 月 7 日 01:00
    00:21

    MathKernel发布多引擎数学内核

    MathKernel作为Python库和MCP服务器发布,支持精确、符号、形式化等多种计算,并带有信任标签和完整溯源,为…

    ↗ 查看原文 · github.com
  7. 9 月 6 日 20:00
    19:41

    Mozaik:并发AI智能体入门介绍

    文章以通俗语言介绍Mozaik,解释并发AI智能体概念,区别于传统流水线模式,强调多智能体并行协作。

    ↗ 查看原文 · dev.to
  8. 9 月 6 日 06:00
    05:26

    逆问题:反向预测为何比想象中更难

    文章探讨机器学习中逆问题的挑战,指出从输出反推输入比常规正向预测更复杂。

    ↗ 查看原文 · dev.to
  9. 9 月 5 日 23:00
    22:42

    LLM结构化输出:重试-修复循环模式解析

    文章提出确保LLM结构化输出可靠需三层机制:约束解码、自有JSON Schema验证及有界重试-修复循环,并给出了具体实…

    ↗ 查看原文 · dev.to
  10. 9 月 5 日 21:00
    20:02

    新论文:LLM传播或引发认知依赖临界点

    一篇arXiv论文将LLM扩散类比为病毒传播,建模用户从不使用到依赖的转变,指出越过临界点后可能引发群体性认知能力下降…

    ↗ 查看原文 · arxiv.org
  11. 9 月 5 日 17:00
    16:05

    从零实现Raft共识的分布式键值存储经验

    作者分享了从零开始用Raft共识算法构建分布式键值存储的学习心得。文章指出分布式共识问题看似简单,实际实现复杂,可能对开…

    ↗ 查看原文 · dev.to
  12. 9 月 5 日 15:00
    14:41

    漏洞检测模型作弊论文后续:结果大部分真实

    作者上周发表论文称漏洞检测模型主要靠读取数据作弊,后续研究澄清该模型大部分行为是真实的,并非完全作弊。

    ↗ 查看原文 · dev.to
  13. 9 月 5 日 12:00
    11:15

    可解释性证明信号使用,智能体记忆缺乏类似工具

    可解释性研究开发工具证明模型信号被实际使用,而智能体记忆领域缺乏此类验证手段。

    ↗ 查看原文 · dev.to
  14. 9 月 5 日 06:00
    05:32

    自改进 AI 代理第 6 章:炒作与现实差距

    文章探讨自改进 AI 代理的炒作与现实差距,并分析其潜在风险与未来发展方向。

    ↗ 查看原文 · dev.to
  15. 05:08

    贪婪指标误导模型改进,pass@64骤降

    仅基于结果的强化学习在玩具系统上看似提升贪婪指标,却破坏了采样通道,导致pass@64从0.83跌至0.19。

    ↗ 查看原文 · dev.to
  16. 9 月 4 日 14:00
    14:00

    Agent 自我进化综述:覆盖 2023-2025 年方法

    一篇系统综述,梳理 2023 至 2025 年间 Agent 自我进化方法,涵盖模型、上下文、工具和架构层的进化内容、时…

    ↗ 查看原文 · dev.to
  17. 9 月 4 日 10:00
    09:07

    AI 架构可绕过 LLM 实现零令牌扩展

    文章探讨了代理系统的扩展悖论,提出最佳 AI 架构可能通过跳过 LLM 来支持万级代理,实现零令牌运行。

    ↗ 查看原文 · dev.to
  18. 09:04

    RLVR 或损害搜索能力,贪婪指标难察觉

    一项受控玩具规模测试发现,仅用结果奖励的 RLVR 可能产生推理而非重新分配搜索,并存在两种评估盲点,如贪婪上升但 pa…

    ↗ 查看原文 · dev.to
  19. 9 月 4 日 09:00
    08:57

    ScienceDiscovery用树搜索加速科学发现

    ScienceDiscovery实现树搜索驱动的RSI,无需训练模型或调参,可在小时级写出通用积分器,低成本发现物理科学…

    ↗ 查看原文 · qbitai.com
  20. 9 月 3 日 20:00
    19:18

    OpenAI 开源 Lean 4 素数间隙形式化证明

    OpenAI 发布 PrimeGaps186 仓库,包含素数间隙不超过 186 的 Lean 4 形式化证明和 Pyth…

    ↗ 查看原文 · github.com
  21. 9 月 3 日 17:00
    16:37

    GRPO 隐藏虚假优势,SIGNBALANCE 提出修正

    研究发现 GRPO 在奖励小候选集等场景会错误奖励猜测行为,提出新方法 SIGNBALANCE 通过全局缩放和类别重平衡…

    ↗ 查看原文 · arxiv.org
  22. 16:10

    可编辑视觉设计新范式:结合代码与扩散模型

    提出 Editable Visual Design 范式,由编码代理驱动,VLM 负责创意规划,图像生成模型产出素材,最…

    ↗ 查看原文 · arxiv.org
  23. 9 月 3 日 15:00
    14:55

    两阶段强化学习提升代码测试生成质量

    提出 TCS 框架,通过两阶段强化学习训练测试生成器,先保证测试与参考解一致,再针对当前失败模式生成对抗性测试,在 TA…

    ↗ 查看原文 · arxiv.org
  24. 14:44

    RATL 提出残差检索新范式,提升多变量时间序列预测

    RATL 是一种即插即用的残差检索与反馈修正方法,通过冻结基础预测器并检索历史残差来改进预测。实验表明,该方法在多数设置…

    ↗ 查看原文 · arxiv.org
  25. 14:36

    论文提出价值保持架构,保障智能体系统人类价值观

    该论文探讨多智能体系统中架构设计如何影响隐私、公平和安全等价值观,并提出三种模式:联邦拓扑保护隐私、分布式架构促进多元…

    ↗ 查看原文 · arxiv.org
  26. 14:02

    STAIR 利用目录结构提升文档检索准确率

    STAIR 检索系统利用目录等全局结构增强 LLM 的信息检索能力,在 SearchTome 基准上 Recall@1…

    ↗ 查看原文 · arxiv.org
  27. 9 月 3 日 13:00
    12:59

    DNative-Twin:用数字孪生记录与重放AI决策

    DNative-Twin框架将AI代理的决策记录为类型化轨迹,并可在隔离环境中重放决策机制。实验表明,加入重放合约和验证…

    ↗ 查看原文 · arxiv.org
  28. 12:23

    SimSkill:终身学习AI代理自主掌握交通模拟

    SimSkill是一个基于SUMO交通模拟器的自进化代理,通过自主探索构建可复用技能库。在多个基准测试中,它将验证完成率…

    ↗ 查看原文 · arxiv.org
  29. 12:20

    Rent-a-RAG:嵌入空间水印审计第三方RAG复用

    DirBucket框架通过语义保持的改写嵌入水印,使数据提供商能在黑盒条件下审计其文档是否被第三方RAG系统未经授权复用…

    ↗ 查看原文 · arxiv.org
  30. 9 月 3 日 12:00
    12:00

    主动服务代理:统一决策框架、方法与评估综述

    这篇综述定义了主动服务代理问题,将其形式化为受授权和风险约束的部分可观测序列决策过程,并梳理了现有方法、评估指标及部署挑…

    ↗ 查看原文 · arxiv.org
  31. 11:50

    《Attention Is All You Need》在 Crossref 有五个假孪生

    查询 Crossref 发现,2017 年 Vaswani 等人的论文《Attention Is All You Nee…

    ↗ 查看原文 · dev.to
  32. 9 月 3 日 05:00
    05:00

    测试时策略优化替代监督标签

    研究提出非对称测试时目标,使在线策略蒸馏达到监督 OPSD 性能,无需监督标签。

    ↗ 查看原文 · dev.to
  33. 9 月 2 日 17:00
    16:11

    CodePoisonRAG:针对代码生成的知识投毒攻击

    研究提出CodePoisonRAG框架,通过构造与任务匹配的恶意代码片段,在无需修改底层模型的情况下,使检索增强代码生成…

    ↗ 查看原文 · arxiv.org
  34. 9 月 2 日 12:00
    11:54

    ViSAR:免训练自适应检索提升文档问答

    ViSAR是一种免训练的自适应k检索方法,用于视觉文档问答,可动态确定检索页数,减少RAG延迟最高58.7%,同时保持或…

    ↗ 查看原文 · arxiv.org
  35. 11:07

    LLM法官遗漏检测缺陷:临床笔记盲点研究

    新论文揭示LLM法官在审核AI临床笔记时,对遗漏信息的检测能力接近随机,而通过重构任务可显著提升检测效果。

    ↗ 查看原文 · arxiv.org
  36. 9 月 2 日 11:00
    10:06

    研究:NER提升放射报告通俗摘要质量

    一项研究评估了在生成放射报告通俗摘要时,NER和RAG的效果。结果显示NER能稳定提升可读性和质量,而单独使用RAG无益…

    ↗ 查看原文 · arxiv.org
  37. 9 月 2 日 10:00
    09:37

    NE-R1框架:强化学习优化命名实体识别

    新框架NE-R1通过按需检索机制和强化学习,在命名实体识别任务上取得新突破。其在域内和跨域评估中平均F1分数分别提升2.…

    ↗ 查看原文 · arxiv.org
  38. 9 月 2 日 09:00
    08:21

    PaperCompiler:将论文忠实编译为代码仓库

    新工具PaperCompiler通过生成显式的仓库级实现规范,提升了论文到代码的转换保真度。在基准测试上,其参考保真度相…

    ↗ 查看原文 · arxiv.org
  39. 9 月 2 日 07:00
    06:54

    研究:人类干预可影响多智能体医疗系统诊断

    一项研究分析了人类在多智能体医疗系统对话中的干预效果。正确干预可将诊断准确率提升高达40%,而错误或带偏见的干预则会使性…

    ↗ 查看原文 · arxiv.org
  40. 06:20

    蚂蚁OmniTable获VLDB最佳论文,大模型数据清洗效率提升5.6倍

    蚂蚁集团推出统一宽表系统OmniTable,论文获VLDB 2026工业赛道最佳论文。该系统处理35PB语料,效率提升5…

    ↗ 查看原文 · qbitai.com
  41. 9 月 2 日 06:00
    05:33

    判别式与生成式模型:实际学习内容解析

    文章探讨监督模型映射输入到输出时,并非所有模型都在学习相同内容,区分判别式与生成式模型。

    ↗ 查看原文 · dev.to
  42. 05:25

    研究:AI智能体比例重塑人类群体共识形成

    一项实验发现,混合人机群体中AI智能体的比例会改变共识形成方式。低比例促进人类主导共识,高比例则转向AI主导,且共识内容…

    ↗ 查看原文 · arxiv.org
  43. 9 月 2 日 05:00
    05:00

    动态生成工具提升LLM智能体成功率

    研究显示,在推理时动态生成定制工具,可将LLM智能体的任务成功率提升最多20%。

    ↗ 查看原文 · dev.to
  44. 9 月 2 日 02:00
    01:49

    LexIssue:中文民事诉讼法律争议点识别基准发布

    研究团队推出LexIssue基准,包含430个真实中文民事案件和1303个专家标注争议点,并构建法律知识库以增强检索,实…

    ↗ 查看原文 · arxiv.org
  45. 01:43

    案例研究:LLM编码代理实现系统时的缺陷与评估

    研究记录了一个LLM代理实现多组件数据系统时引入的五类缺陷,并通过HotpotQA基准测试发现,过滤检索在预算为3时达到…

    ↗ 查看原文 · arxiv.org
  46. 9 月 1 日 22:00
    21:39

    BenchMIRT:审计LLM基准测试的新方法

    Hugging Face 和 Ai2 推出 BenchMIRT,一种在单个提示级别审计 LLM 基准测试的方法,通过分析…

    ↗ 查看原文 · huggingface.co
  47. 21:11

    认知女巫抵抗:AI代理数量不等于证据多样性

    研究提出认知女巫问题,指出多代理报告中重复证据可能被误认为独立验证。实验显示,增加报告数量会降低推断校准度,而增加证据根…

    ↗ 查看原文 · arxiv.org
  48. 9 月 1 日 21:00
    20:47

    BCO方法通过显式世界模型提升智能体优化性能

    Belief-Calibrated Optimization将智能体对环境响应的隐式信念写成持久文档,并随新候选评估持续…

    ↗ 查看原文 · arxiv.org
  49. 9 月 1 日 18:00
    17:59

    ACToR:自适应关键令牌感知检索框架

    ACToR 是一个用于仓库级代码生成的自适应检索框架,能识别关键令牌并触发定向检索。在 RepoExec 和 Coder…

    ↗ 查看原文 · arxiv.org
  50. 17:57

    面向对齐与控制的机制设计框架

    新论文提出一个机制设计框架,用于处理对齐和能力未知的 AI 代理,通过激励诚实和服从,并应用于沙袋效应、可解释性权衡等场…

    ↗ 查看原文 · arxiv.org