AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 16 日 12:0011:26
- 9 月 16 日 11:0011:00
- 10:27
WetRobo:面向生物实验室的可复现机器人套件
↗ 查看原文 · arxiv.org研究者构建 WetRobo 机器人套件,包含机械臂、实验室器材、遥操作演示与 AGENTS.md 技能文件,让编码智能体…
- 9 月 16 日 10:0009:12
- 9 月 16 日 09:0008:41
- 08:36
Graph-RAG 与标准 RAG 在文化类问答上的对比研究
↗ 查看原文 · arxiv.org研究在 LatamQA 文化多选题数据集上对比 Graph-RAG 与标准 RAG,图谱由 Wikipedia 文章经…
- 08:32
研究:提示词自然语言差异影响 LLM 代码生成
↗ 查看原文 · arxiv.org研究用 7 个模型在 AtCoder、LeetCode、BigCodeBench 上测试英文、日文、中文提示对代码生成准…
- 9 月 16 日 07:0006:13
WFM:面向复杂智能体推理的 Wiki 基础模型
↗ 查看原文 · arxiv.org研究提出 Wiki Foundation Model(WFM),用 Wiki Graph 模式连接细粒度结构与稠密上下文…
- 9 月 16 日 06:0005:24
- 05:23
- 05:05
ContrAgent:用契约对 LLM 智能体做符号化时序监督
↗ 查看原文 · arxiv.org研究提出 ContrAgent,将智能体工具调用序列形式化为可检查谓词轨迹,并用 LTLf 假设-保证契约编译成确定性有…
- 9 月 16 日 05:0004:08
EffiRAG:图结构RAG成本降57%,答案质量仍占优
↗ 查看原文 · arxiv.org研究者提出图结构RAG系统EffiRAG,用图定位相关段落、由原文生成答案,在UltraDomain的120个问题上93…
- 9 月 16 日 04:0004:00
Agora:用Git做多智能体共享研究记忆
↗ 查看原文 · arxiv.orgAgora把研究过程记录为存于Git的只追加DAG,每条结论都是可复现的提交。13个模型worker无中心调度运行近12…
- 03:07
- 9 月 16 日 03:0002:55
低成本LLM写企业代码:结构合规但正确率仅12.9%
↗ 查看原文 · arxiv.org研究让Gemini Flash 3、GPT-5.4 mini和Claude Haiku 4.5按规格生成Java Spr…
- 9 月 16 日 02:0001:21
- 01:15
RideWay:用效率指标评测工具调用智能体
↗ 查看原文 · arxiv.org新基准RideWay针对网约车场景,提出成功门控的Efficiency Utility指标,按多余工具调用和对话轮次扣分…
- 01:14
TuiML:为 AI Agent 设计的机器学习库开源
↗ 查看原文 · arxiv.orgarXiv 论文提出 TuiML,一个面向 AI Agent 的机器学习库,组件带机器可读元数据与参数模式,调用可校验…
- 01:13
- 9 月 16 日 00:0023:40
论文:定位隐藏失败可提升长程 Agent 可靠性
↗ 查看原文 · arxiv.orgarXiv 论文分析 2518 条 Agent 轨迹,将 6967 个错误归为 78 种失败类型,发现 Agent 首次…
- 23:22
- 9 月 15 日 21:0020:32
- 9 月 15 日 20:0019:07
研究:RL 后训练中难样本几乎不提升,提出 Never Give Up 方法
↗ 查看原文 · mnoukhov.github.io一篇博客介绍其 RL 后训练论文,指出 AIME 评测中简单题大幅提升、初始 pass@32 为 0 的难题几乎无改善…
- 9 月 15 日 19:0018:34
循环 Transformer RLT:让模型不必遗忘上下文
↗ 查看原文 · dev.toDEV 社区文章介绍 Recurrent Looped Transformer(RLT),探讨 Transformer…
- 18:20
论文提出 DRAG:按查询动态选择 RAG 检索器与生成器
↗ 查看原文 · arxiv.org研究系统分析了检索器与生成器复杂度在事实型和多跳问答中的交互,发现更强检索收益更大但存在递减与非单调回报。
- 18:10
- 9 月 15 日 18:0017:57
论文提出 agentic society 需要「社会 harness」
↗ 查看原文 · arxiv.orgarXiv 论文指出,在跨信任边界的多智能体协作中,即使诚实且能力足够的智能体也常因现有通信机制而失败,恶意智能体还可利…
- 17:37
HN 讨论:Navier-Stokes 之后仍看空 LLM
↗ 查看原文 · dank.systemsHacker News 上出现一篇长文,作者称即便模型在 Navier-Stokes 等任务上有所表现,他仍对 LLM…
- 9 月 15 日 17:0016:53
Fathom:面向卸载 KV 缓存的按查询读取深度稀疏解码
↗ 查看原文 · arxiv.org针对百万 token 智能体会话中 KV 缓存索引扫描成为解码瓶颈的问题,Fathom 让每个查询自行决定读取每个 ke…
- 16:29
- 16:29
研究称 SWE-bench 榜单已无法区分头部编码智能体
↗ 查看原文 · arxiv.org一项对 254 份 SWE-bench 提交的审计发现,Verified 分榜前两名各解决 500 题中的 396 题…
- 16:27
FlashVector:跨层优化模型服务栈的智能体系统
↗ 查看原文 · arxiv.org论文提出 FlashVector,把单 GPU 内核优化智能体扩展到框架计算图、模型服务器和特征处理等异构层。
- 9 月 15 日 16:0016:00
- 9 月 15 日 15:0014:50
研究复盘 OpenClaw 技能生态爆发后的治理难题
↗ 查看原文 · arxiv.org论文基于 OpenClaw 的 Git 历史与三份 ClawHub 快照,发现技能库 91 天内近乎翻倍,但 77.86…
- 14:40
OpenShell 分享用形式化方法管控 AI Agent 的经验
↗ 查看原文 · nvidia.github.ioOpenShell 团队撰文介绍如何用 Z3 开源库对 Agent 提出的权限变更做形式化证明,确保其不超出已批准的策略…
- 14:31
GRP-Obliteration:单条无标注提示即可解除 LLM 对齐
↗ 查看原文 · arxiv.org微软等机构研究者提出 GRP-Obliteration,用 GRPO 直接移除模型安全约束,单条无标注提示即可稳定解除对…
- 9 月 15 日 14:0013:41
近五千名数学家联署:AI 正在破坏专业能力的判断标准
↗ 查看原文 · seangoedecke.com近五千名数学家(含25位菲尔兹奖得主)签署声明《AI 在数学中的严重错位》,认为 AI 解题只是手段,概念理解才是目标…
- 13:05
- 9 月 15 日 13:0012:48
GPT-6 Astra 参与 2D CFET 热电协同设计
↗ 查看原文 · arxiv.org论文用 AI 智能体工作流在给定热电模型内研究 2D CFET 逆变器热设计,Astra 选出重分布源极互连结构,配合协…
- 12:32
实测 120 个 AI 生成函数:未发现静默吞错
↗ 查看原文 · dev.to有人用 Semgrep 检测器加人工判定,检查本地生成的 120 个 Python/TypeScript 函数,所有被标…
- 9 月 15 日 12:0011:23
ORDER:按查询动态调整 RAG 索引与检索
↗ 查看原文 · arxiv.org研究者提出 ORDER 框架,先对语料相关问题聚类,为每类学习分块、元数据过滤与重排配置,推理时按最近质心路由查询,并用…
- 9 月 15 日 11:0010:11
- 9 月 15 日 09:0008:50
- 08:39
- 9 月 15 日 07:0006:37
Meta 提出字节级蒸馏,下游准确率上限高 4 个百分点
↗ 查看原文 · qbitai.comMeta FAIR 与华盛顿大学论文提出把蒸馏的学习单位从 Token 换成 Byte,并给出 Marginalize-…
- 06:31
LLM 数学差并非能力问题,而是它本就没在做数学
↗ 查看原文 · dev.to有文章指出,大模型在数学任务上的表现不佳,根源在于它并非真正执行计算,而是在做模式匹配。这一视角影响对模型能力边界的判断…
- 06:01
little m:面向工业过程优化的 AI 智能体
↗ 查看原文 · arxiv.org研究者提出智能体 little m,结合领域知识库与 LLM 交互,把自然语言和工艺图转化为数学优化模型,并发布含 50…
- 9 月 15 日 05:0005:00
Steering vectors 让 LLM 对齐人类价值观
↗ 查看原文 · dev.to一项讨论指出,从大模型激活分布中提取的线性方向可对应人类价值取向,可用于引导模型行为。这为模型对齐提供了一种基于激活层面…
- 04:38
AURA:面向生产推荐系统的智能体诊断与改进
↗ 查看原文 · arxiv.orgAURA 是一套端到端智能体系统,可读取生产互动日志,规模化定性评估推荐质量并定位失败模式,再结合代码与训练管线提出并实…
- 9 月 15 日 04:0003:58
ExecuCritic:用执行反馈联合训练代码模型与评审器
↗ 查看原文 · arxiv.org研究者提出 ExecuCritic,让代码模型与评审器在同一批执行轨迹上联合训练,评审器预测通过与否并给出简短诊断反馈…