跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 1 日 18:00
    17:54

    arXiv 论文探索写作中的主动思维伙伴设计

    论文研究了写作中主动提供高层次认知支持的 AI 代理设计空间,通过技术探针部署一周发现,用户重视可配置角色和主动性,以及…

    ↗ 查看原文 · arxiv.org
  2. 9 月 1 日 17:00
    17:00

    普渡大学论文:同策略蒸馏无需教师模型

    普渡大学新论文分析同策略蒸馏中的教师监督,发现教师评分多为噪声,固定负惩罚在AIME24上优于完整教师模型。

    ↗ 查看原文 · dev.to
  3. 16:05

    Agent 记忆可简化为文件系统实现

    作者指出 AI 代理常因遗忘而缺陷,提出将记忆视为文件系统,构建可实际使用的记忆场,以增强代理的持久性。

    ↗ 查看原文 · dev.to
  4. 9 月 1 日 15:00
    14:43

    VerTox 框架揭示神经排序模型易受语料投毒攻击

    研究提出 VerTox,首个将语料投毒建模为可验证奖励引导强化学习问题的框架,能生成流畅且难检测的对抗文档,攻击成功率接…

    ↗ 查看原文 · arxiv.org
  5. 14:42

    Transformer 论文回顾:从翻译到 ChatGPT 的演进

    Google 研究人员在改进机器翻译时,突破瓶颈催生了 Transformer 架构,进而推动了 GPT、BERT 等模…

    ↗ 查看原文 · dev.to
  6. 9 月 1 日 14:00
    13:35

    论文提出 AI 驱动持续自主重构研究路线图

    该论文设想将 LLM 重构作为软件维护的持续组件,而非偶尔使用的工具,并围绕多目标优化、质量定义等五个维度提出研究议程…

    ↗ 查看原文 · arxiv.org
  7. 9 月 1 日 12:00
    11:47

    代码生成中提示的作用:救急不救学

    研究测试提示对代码生成的影响,发现相关提示能修复部分失败,但多数修复结果通过普通采样也能获得,内部干预未带来能力迁移。

    ↗ 查看原文 · arxiv.org
  8. 11:35

    知识图谱提升LLM高能物理代码可靠性

    新系统结合软件知识图谱与检索,在ROOT框架任务上首次执行成功率提升至76%,最终成功率96%,成本仅增1.3%。

    ↗ 查看原文 · arxiv.org
  9. 9 月 1 日 09:00
    08:01

    REG 2025基准评估病理学视觉语言模型

    发布约10,500对全切片图像-报告数据集,建立REG 2025基准,发现结构化报告表示和分层诊断分解对高性能更关键。

    ↗ 查看原文 · arxiv.org
  10. 9 月 1 日 08:00
    07:56

    强化学习增强LLM代理求解车辆路径问题

    RLEA框架结合强化学习与LLM代理,在48种VRP变体上成功率比先前方法高16.67%,显著减少运行时错误。

    ↗ 查看原文 · arxiv.org
  11. 07:56

    可验证灾害故事线管道整合人道主义数据

    新管道结合结构化与非结构化数据,生成带引用的灾害故事线和因果知识图谱,专家评估确认高检索精度和忠实度。

    ↗ 查看原文 · arxiv.org
  12. 07:44

    预训练嵌入重现人类遗忘曲线

    研究用未修改的预训练嵌入复现了艾宾浩斯遗忘曲线和经典错误记忆率,无需参数调整,揭示了智能体记忆衰减的原因。

    ↗ 查看原文 · dev.to
  13. 07:27

    Agent 记忆基准:更多记忆未必更好

    讨论 Agent 记忆基准,指出对于 Agentic AI,更多记忆并不一定带来更好性能,引发对记忆效率的思考。

    ↗ 查看原文 · dev.to
  14. 9 月 1 日 05:00
    04:12

    复旦Neolab提出生命算子,统一生命建模

    复旦Neolab团队提出生命算子,旨在统一生命建模,并已连发六篇Nature期刊,打通全尺度生命推演。

    ↗ 查看原文 · qbitai.com
  15. 9 月 1 日 03:00
    02:04

    WiseSpec框架:需求驱动提升代码生成准确率

    WiseSpec是一个面向仓库级代码生成的需求驱动智能体框架,通过自动构建结构化需求、执行评估并迭代优化,指导代码生成。…

    ↗ 查看原文 · arxiv.org
  16. 9 月 1 日 02:00
    01:30

    TrustPropRAG:基于反馈的文档信任传播提升RAG可靠性

    TrustPropRAG将文档关系构建为图,通过多跳传播和少量人工反馈估计文档信任度,用于改进检索和答案生成。评估显示其…

    ↗ 查看原文 · arxiv.org
  17. 9 月 1 日 01:00
    00:27

    ISO-RAG:几何感知框架降低多跳问答延迟

    ISO-RAG将知识图谱投影到双曲空间,通过拓扑净化剪枝噪声边,限制检索子图,提升多跳问答的检索召回率和精确匹配,同时消…

    ↗ 查看原文 · arxiv.org
  18. 9 月 1 日 00:00
    23:27

    EGT-KG:证据接地知识图谱提升小型语言模型科学问答

    EGT-KG是一个检索框架,通过证据接地的类型化知识图谱,增强小型语言模型在科学问答中的信息检索。在特定文献基准上,其最…

    ↗ 查看原文 · arxiv.org
  19. 23:21

    TRIS三层筛:防御RAG知识投毒攻击

    TRIS是一种中间件防御,通过跨嵌入空间聚类、结构过滤和一致性验证,净化检索证据。在多个基准上,它将黑盒攻击成功率从最高…

    ↗ 查看原文 · arxiv.org
  20. 23:16

    研究:新模型单提示词可超越多数LLM技术方案

    一项研究分析了ICSE 2026的35篇LLM技术论文,发现37%至63%的复杂工具可被新模型上的单提示词原生超越,尤其…

    ↗ 查看原文 · arxiv.org
  21. 8 月 31 日 21:00
    20:55

    反馈驱动LLM代码修复的复制与Java扩展研究

    研究部分复制了FeedbackEval基准,并扩展至Java,发现Python中的结论可能受基准构建、反馈表示和工具生态…

    ↗ 查看原文 · arxiv.org
  22. 8 月 31 日 19:00
    18:42

    门控记忆路由提升多智能体LLM系统协作效率

    提出门控记忆路由方法,通过学习写入和检索门控,仅保留非冗余推理步骤,在多基准上提升准确率并降低推理成本。

    ↗ 查看原文 · arxiv.org
  23. 8 月 31 日 18:00
    17:44

    可配置语义分块框架提升生物医学信息抽取

    BioMedRAG 依赖固定大小分块,可能割裂语义证据。新提出的可配置语义分块框架,在生物医学关系抽取基准上,将 F1…

    ↗ 查看原文 · arxiv.org
  24. 17:44

    OntoAligner-Ensemble 融合异构本体对齐技术

    新框架通过投票融合与后选择策略,整合词汇、知识图谱嵌入及大语言模型等多种对齐器。实验显示,集成方法能稳定改善精确率与召回…

    ↗ 查看原文 · arxiv.org
  25. 17:30

    受控研究揭示大模型规模对本体的学习影响

    对 13 个模型进行受控评估,发现增加参数主要提升精确率而非召回率,且效果不单调。架构和模型血统可能比名义参数数量更重要…

    ↗ 查看原文 · arxiv.org
  26. 8 月 31 日 17:00
    16:42

    LoopArena:分析编码智能体外循环失败原因

    阿里DreamX团队与新南威尔士大学发布论文LoopArena,研究编码智能体在外循环中失败的原因,论文已上传至arXi…

    ↗ 查看原文 · dev.to
  27. 16:37

    14 个说话人编码器错误率差异达五倍

    一项实验测试了 14 个说话人编码器,它们处理同一语音时错误率相差五倍,凸显了不同模型性能的显著差异。

    ↗ 查看原文 · dev.to
  28. 16:34

    评估编码代理工作记忆需考虑语义异质性

    对 55 个编码代理轨迹的分析显示,不同语义的工作记忆对象具有不同的保留和压缩行为。研究指出,仅用名义令牌预算评估记忆管…

    ↗ 查看原文 · arxiv.org
  29. 8 月 31 日 16:00
    15:15

    生成式AI用于腐蚀机理推理的新框架

    研究提出领域适配的检索增强生成框架,用于腐蚀知识合成,在镁合金腐蚀上验证。微调三个开源模型后,检索增强使Token F1…

    ↗ 查看原文 · arxiv.org
  30. 15:07

    Anthropic 新论文预示 AI 对齐方向转变

    Anthropic 新论文实验显示 Claude 能自动化自身安全对齐,表现优于人类专家,暗示未来模型将更多参与自身安全…

    ↗ 查看原文 · dev.to
  31. 8 月 31 日 14:00
    13:18

    新基准AM-Bench揭示纯文本LLM的2D空间推理能力

    研究引入AM-Bench基准,测试纯文本模型的空间推理。结果显示模型能可靠地将几何描述转为代码,但开放式布局能力差异大…

    ↗ 查看原文 · arxiv.org
  32. 8 月 31 日 13:00
    12:26

    研究揭示用户调用方式影响编码代理仓库投毒风险

    新基准CIPR通过1920个实例测试发现,编码代理的漏洞高度依赖任务类型,测试执行任务成为静默攻击面,提示词表达也会间接…

    ↗ 查看原文 · arxiv.org
  33. 8 月 31 日 12:00
    11:28

    合成数据可隐蔽注入目标偏见,威胁LLM安全

    研究展示通过看似良性的合成数据可向对齐模型注入定向社会偏见,同时保留任务能力。这揭示了合成数据训练管线中的新安全风险。

    ↗ 查看原文 · arxiv.org
  34. 8 月 31 日 10:00
    09:29

    CM2 框架提出多智能体文化推理新方法

    研究提出 CM2 多智能体框架,整合多模态感知、检索增强生成等模块,用于提升多模态大模型在跨学科文化推理上的表现,实验显…

    ↗ 查看原文 · arxiv.org
  35. 09:04

    Pera 架构推动持久 AI 代理发展

    论文提出以感知为中心的 Pera 架构,用于设计能持续适应环境变化的持久 AI 代理,并回顾现有工作,为长期智能系统提供…

    ↗ 查看原文 · arxiv.org
  36. 8 月 31 日 06:00
    05:47

    构建FAISS、BM25与smolagents的混合RAG系统

    作者分享学习RAG过程中,结合FAISS、BM25和smolagents构建代理式混合RAG系统的经验,旨在提升检索与生…

    ↗ 查看原文 · dev.to
  37. 8 月 30 日 21:00
    20:46

    连续扩散语言模型复兴,挑战自回归霸权

    Sander Dieleman发文称,连续扩散语言模型近期研究活跃,正从离散扩散方法手中夺回阵地,可能改变语言生成的技术…

    ↗ 查看原文 · sander.ai
  38. 20:30

    新方法DuoSteer提升代码生成安全性与正确性

    研究提出CodeSec-Pairs数据集和DuoSteer双重引导方法,通过机制性解释定位安全相关组件,在多个模型上将漏…

    ↗ 查看原文 · arxiv.org
  39. 8 月 30 日 19:00
    18:36

    SearchWiki框架将语料转为可导航知识维基

    SearchWiki将语料库综合为分层维基,并训练WikiResearcher-9B智能体通过多轮工具使用检索信息。在多…

    ↗ 查看原文 · arxiv.org
  40. 18:28

    ScholarAgent:AI代理可复现研究论文

    ScholarAgent 是一个AI代理,旨在复现研究论文的实验结果,而不仅仅是阅读内容,可能改变研究验证方式。

    ↗ 查看原文 · dev.to
  41. 18:08

    地球最长直线路径计算研究回顾

    文章回顾了2018年关于地球表面水上或陆地最长直线路径的研究,探讨了地理计算中的有趣问题。

    ↗ 查看原文 · dev.to
  42. 8 月 30 日 15:00
    14:29

    AI 代理代码生成可靠性工程第三部分发布

    本文是系列第三部分,聚焦代理团队、事后复盘及前沿实践,延续前文定义的八种失败模式,探讨提升 AI 代码生成的可靠性。

    ↗ 查看原文 · dev.to
  43. 8 月 30 日 13:00
    12:33

    PAGE-RAG方法提升多跳问答检索准确性

    PAGE-RAG通过构建查询局部图并利用来源追踪等信号筛选候选,解决了检索中的连接-支持差距。在多个基准上,该方法显著提…

    ↗ 查看原文 · arxiv.org
  44. 12:20

    ReTrace方法加速推测解码推理速度

    ReTrace通过条件化被拒绝的轨迹片段,保留其隐藏表示并用于下一轮草稿生成,在不增加额外前向传播的情况下,提升了平均接…

    ↗ 查看原文 · arxiv.org
  45. 8 月 30 日 11:00
    10:50

    AI代理验证liblzma解码器内存安全

    研究团队使用VST工具链和AI代理,验证了liblzma解码器组件的内存安全,发现原始LZMA1零输入处理中的未定义行为…

    ↗ 查看原文 · arxiv.org
  46. 8 月 30 日 08:00
    07:31

    AgenticRag-R1 框架发布,强化学习结合栈记忆提升多步推理

    AgenticRag-R1 提出一种强化学习框架,通过栈记忆和细粒度动作空间整合推理、检索与记忆,并采用分层奖励和轨迹拒…

    ↗ 查看原文 · arxiv.org
  47. 8 月 30 日 07:00
    06:36

    论文提出智能体技能系统基础架构,涵盖九阶段生命周期

    该论文为智能体技能建立统一系统基础,将其形式化为外部化程序知识,并详细阐述从自主发现到安全治理的九阶段生命周期,同时探讨…

    ↗ 查看原文 · arxiv.org
  48. 8 月 28 日 20:00
    19:09

    构建24/7自主代理守护进程的工程白皮书

    发布2026年工程白皮书,详述如何构建全天候自主代理守护进程,涉及DeepSeek-R1、Hermes-3、NVIDIA…

    ↗ 查看原文 · dev.to

exit 0