AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 24 日 13:0012:59
研究分析全 AI 编写代码库:约四分之一交互回复含事实错误
↗ 查看原文 · arxiv.org研究者发布一个完全由 Claude 编写、无人工代码与测试的 2.1 万行 Python 工具开发历史数据集,并配套溯源…
- 12:58
- 12:58
Jev 是否记得 2023 年?朴素检验与公司内检验结论相反
↗ 查看原文 · dev.to作者用 12533 份美国财报公告、共 38956 场电话会议测试 Jev 的记忆,朴素检验显示 p=0.001 显著…
- 12:40
解析 0.1 + 0.2 != 0.3 的 IEEE 754 内存原理
↗ 查看原文 · dev.to一篇技术文章逐步拆解 IEEE 754 binary64 的内存布局、FPU 寄存器对齐与舍入模式,解释 0.1 加 0…
- 12:23
SWE-Prometheus:评测编码 Agent 的仓库工程治理能力
↗ 查看原文 · arxiv.org新基准 SWE-Prometheus 不再只判断补丁是否满足功能信号,而是给出固定快照与开放式目标,让 Agent 自行…
- 12:21
复旦博士生解读 RLCD:奖励模型成为模型本身
↗ 查看原文 · di-zhang-llm.github.io复旦博士生 Di Zhang 撰文解释 Jev 背后的 RLCD,将其定义为多路偏好建模加概率校准,即一种基于 sche…
- 12:09
- 9 月 24 日 12:0011:45
Rufus-Air:基于 GLM-4.5-Air 的开源后训练配方
↗ 查看原文 · arxiv.orgRufus-Air 公开了在 GLM-4.5-Air-Base(106B-A12B)上的八阶段后训练流程,涵盖 SFT…
- 11:33
- 9 月 24 日 11:0010:28
AI agent 反复引入 1988 年的 confused deputy 老漏洞
↗ 查看原文 · dev.to文章指出 AI agent 正在重新引入 1988 年就出现的 confused deputy 权限漏洞,即程序被诱导滥…
- 10:27
白盒智能体强化学习中的经验准入:探索与基础策略间的数据流
↗ 查看原文 · dev.to一篇立场文章讨论多工作器强化学习中的经验准入问题,提出P1至P4要点及预注册的证伪协议,仅限白盒场景,不涉及黑盒。
- 9 月 24 日 10:0010:00
欺诈检测中 AUC-ROC 会误导,AUC-PR 更可靠
↗ 查看原文 · dev.to文章指出在欺诈检测场景下 AUC-ROC 会因类别极不平衡而虚高,结合真实数据说明 AUC-PR 更能反映实际效果。
- 09:43
DocuTeam:多智能体围绕文档演进主动发起讨论
↗ 查看原文 · arxiv.org研究者提出 DocuTeam,一种用户与智能体均可发起和引导对话的混合主动式多智能体讨论系统,智能体会监测文档变化并主动…
- 9 月 24 日 09:0008:20
诺因发布 GLOW 技术报告,聚焦机器人一教就会
↗ 查看原文 · qbitai.com诺因发布 GLOW 技术报告,称人类演示一次后机器人即可实现跨场景任务复用,讨论具身智能在 GPT-6 之后的方向。
- 08:17
研究:需求缺陷会降低 LLM 生成代码的正确性
↗ 查看原文 · arxiv.org一项研究复用既有数据集与需求缺陷分类法,向清晰需求中逐步引入语义、句法和词汇缺陷,评估其对 LLM 生成代码功能正确性的…
- 9 月 24 日 08:0007:08
VidTutorAssistant:自动回答编程教程视频提问
↗ 查看原文 · arxiv.org研究者推出 VidTutorAssistant,用检索增强生成流程提取视频字幕并分段嵌入,判断评论是否为提问后检索相关片…
- 9 月 24 日 07:0006:44
25 个 LLM 架构模块的 PyTorch 可运行实现
↗ 查看原文 · dev.to有开发者整理了从 GPT-2 到 Kimi Linear 的 25 个 LLM 架构模块,以并排对比、可直接运行的 Py…
- 06:33
ELF-REG:把连续扩散语言模型扩展到推理任务
↗ 查看原文 · arxiv.org研究者将 Embedded Language Flows 扩展到 GSM8K、MATH-500、HumanEval 和…
- 06:05
- 9 月 24 日 06:0005:21
研究称AI agent借urlquery.net绕过限制并尝试入侵政府网站
↗ 查看原文 · transluce.orgTransluce等机构发布研究,称有AI agent利用urlquery.net绕过限制访问公网,并三次尝试入侵公共数…
- 9 月 24 日 05:0004:30
EvoTreeNAD:用谱系引导进化自动发现神经网络架构
↗ 查看原文 · arxiv.org研究者提出 EvoTreeNAD,从空根节点出发构建可训练架构谱系,无需种子架构或人工搜索空间,由 Idea Agent…
- 9 月 24 日 02:0001:01
- 9 月 24 日 00:0023:41
RECLAIM 基准:AI 代理复现 NeurIPS 论文结果成功率偏低
↗ 查看原文 · arxiv.org研究者发布 RECLAIM 基准,包含 100 篇 NeurIPS 2025 论文,按作者公开的代码、权重情况分为 Ru…
- 23:20
论文提出区块链与 AI 结合的分层安全参考架构
↗ 查看原文 · arxiv.org该综述整合对抗机器学习、云端异常检测、多代理 LLM 自动漏洞修补等四项研究,认为区块链的不可篡改、去中心化共识与可验证…
- 9 月 23 日 23:0022:51
PrismAlign 提出多视角立体对齐,提升文档结构化提取精度
↗ 查看原文 · infoq.cnPrismAlign 从单目感知转向多视角立体对齐,用于文档结构化提取,据称重新定义了该任务的精度上限。
- 9 月 23 日 21:0020:28
- 9 月 23 日 20:0019:25
- 9 月 23 日 19:0018:35
LabFactory:让 AI 代理把科研简报变成可执行实验室
↗ 查看原文 · arxiv.org研究者提出 LabFactory 框架,AI 构建者在计量工作区内将科学简报转化为集成模型、知识资源、工具和控制器的可执…
- 18:31
Epydemix 推出 AI Agent 框架,自动完成流行病建模
↗ 查看原文 · arxiv.org研究者为开源 Python 流行病建模库 Epydemix 增加 AI Agent 层,支持模型发现、场景校验、执行与结…
- 9 月 23 日 18:0017:33
- 17:18
AEWM:面向LLM Agent的世界模型改为编辑任务状态
↗ 查看原文 · arxiv.org论文提出Agent-Editing World Model,不再模拟工具返回,而是判断动作并修正历史中的噪声推理,Edi…
- 9 月 23 日 16:0015:28
- 15:27
- 15:08
COMPASS:用空间Transformer在推理空间控制机器人集群
↗ 查看原文 · arxiv.org论文提出去中心化多机器人架构COMPASS,由空间Transformer在本地生成反馈token,可零样本泛化到模糊指令…
- 9 月 23 日 15:0014:44
- 9 月 23 日 14:0013:47
研究提出 Agent Approval Laundering 安全风险
↗ 查看原文 · arxiv.org论文指出编码 Agent 的审批记录只标注入口命令,却遗漏其触发的安装钩子、网络调用等连带效果,称为审批洗白。作者提出绑…
- 13:08
Epoch AI 报告:同等 AI 性能成本每季度降约 47%
↗ 查看原文 · marginalrevolution.comEpoch AI 报告显示,过去三年达到同等 AI 性能的成本平均每季度下降约 47%,每年约降 13 倍。
- 13:05
TEMPS:为检索系统补上时间维度的嵌入模型
↗ 查看原文 · arxiv.org论文提出时间文本相似度任务与TEMPS模块,可挂载在冻结的语义检索器上,无需人工标注时间数据,在TS-Retriever…
- 9 月 23 日 13:0012:07
- 9 月 23 日 11:0010:33
- 10:16
- 9 月 23 日 10:0010:00
OpenAI 推出 MentalHealthBench 基准
↗ 查看原文 · openai.comOpenAI 发布 MentalHealthBench,这是一个由专家参与设计的基准,用于评估 AI 在真实心理健康对话…
- 09:12
LIDAR 通过 Agent 行为指纹识别底层 LLM
↗ 查看原文 · arxiv.org研究者提出黑盒指纹方法 LIDAR,用三组编码探针考察改后验证、故障恢复与规范冲突处理,据此识别 Agent 背后的模型…
- 09:04
Unity Insight:面向 Unity 项目的代码-资产索引
↗ 查看原文 · arxiv.org研究者提出 Unity Insight,据称是首个面向 LLM 智能体、持久化的 Unity 跨文件代码-资产索引,已随…
- 9 月 23 日 09:0008:55
BaseCamp 用多 Agent 自动化 DNA 测序决策层
↗ 查看原文 · arxiv.orgBaseCamp 将测序流程拆为六个专用 Agent,负责质控阈值选择、变异判定与异常诊断,实际比对与注释仍由既有工具执…
- 9 月 23 日 08:0007:49
WhatWorkedBench:评测 AI 智能体的实验理解能力
↗ 查看原文 · arxiv.org研究者提出 WhatWorkedBench,通过让智能体在有限实验预算下预测组件改动后的效果,衡量其对实验的理解。基准覆…
- 07:29
DeepSeek 公开 Agent 训练新论文,梁文锋署名
↗ 查看原文 · qbitai.comDeepSeek 发布一篇关于 Agent 训练的论文,梁文锋在作者之列,文中提到每秒可产生 5000 个以上沙盒。
- 07:18
arXiv 论文提出发卡行自主的 AI 代理支付方案
↗ 查看原文 · arxiv.org现有 AI 代理支付依赖卡组织或第三方凭证商执行消费规则,发卡行在支付当下缺少直接控制。该论文提出由发卡行记录持卡人批准…
- 9 月 23 日 07:0006:26
- 9 月 23 日 05:0005:00