AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 17 日 16:0015:40
- 15:16
开发者用代码模拟 Fiskardo 山火撤离路线耗时
↗ 查看原文 · dev.to有开发者在 DEV Community 发文,尝试计算山火发生时经公路将人员撤离 Fiskardo 需要多长时间,并以此…
- 9 月 17 日 15:0014:59
- 14:58
SoL-Pi 递归扩展自动研究循环优化 harness
↗ 查看原文 · arxiv.org研究在 harness 层扩展自动研究循环,筛选出动作执行、上下文压缩、观测处理和委托阅读四项机制组成 SoL-Pi。
- 14:53
为何朴素定价在相关组合合约上失效:Copula 的解法
↗ 查看原文 · dev.toDEV Community 文章指出,在串关、同场组合和多腿预测市场等可组合两个事件合约的场景中,朴素定价会因忽略事件相…
- 14:16
- 9 月 17 日 14:0013:37
- 13:13
arXiv 提出混合定性推理模型,用于积木游戏 Camelot Jr.
↗ 查看原文 · arxiv.org论文为积木解谜游戏 Camelot Jr. 设计混合定性推理模型,结合质心稳定性数学逻辑,让 AI 能从空间事件做常识推…
- 9 月 17 日 13:0012:24
- 9 月 17 日 11:0010:56
SERBench 提出面向编码 Agent 的最小充分证据检索
↗ 查看原文 · arxiv.org研究把编码 Agent 的检索重新定义为「补齐当前决策所缺证据」,提出 MSS-Complement 方法,在 45 个…
- 10:30
- 10:27
- 10:22
用模型翻译 locale 文件:引入的 bug 是「正确的日语」
↗ 查看原文 · dev.to有人用四个模型翻译 430 条字符串、四种语言,结果两个模型把 ICU 复数规则译成正确日语,却导致格式化器崩溃,往返相…
- 9 月 17 日 10:0009:40
- 09:33
- 09:20
研究刻画 AI Agent 资源与性能动态,提出任务感知调度
↗ 查看原文 · arxiv.org论文测量检索问答、网页搜索和软件编码三类 Agent 的延迟与资源占用,发现更快的 LLM 响应或更多 CPU 核心并不…
- 09:13
- 9 月 17 日 09:0008:51
研究用编码 Agent 学习并迁移闭环机器人策略代码
↗ 查看原文 · arxiv.org论文把完整闭环机器人实现当作可复用经验:编码 Agent 依据少量示范生成策略代码并用仿真反馈迭代,在 RoboCasa…
- 9 月 17 日 08:0007:06
- 9 月 17 日 07:0006:34
- 9 月 17 日 06:0005:54
- 05:27
LearnActCoder 用角色感知错误记忆改进临床编码
↗ 查看原文 · arxiv.org论文提出 Learn-Then-Act 框架,把少量标注样本中的错误整理成结构化错误知识库,并按假阴性、假阳性分别路由给…
- 9 月 17 日 04:0003:56
PrefixBench-H100:H100 上前缀复用与首字延迟基准
↗ 查看原文 · arxiv.org论文提出 PrefixBench-H100,在单张 H100 上测量 vLLM 与 TensorRT-LLM 的前缀复用…
- 03:27
- 03:08
DataCanvas-EDU:教学场景合成数据生成框架
↗ 查看原文 · arxiv.org论文发布 DataCanvas-EDU,教师通过对话说明教学目标与数据模式,AI 智能体负责生成代码、校验数据并准备作业…
- 03:07
- 9 月 17 日 03:0002:42
DeltaSelect:面向编码智能体的低成本 A/B 测试
↗ 查看原文 · arxiv.org论文提出开源方法 DeltaSelect,通过皮尔逊相关筛选能稳定反映全量基准表现的任务,并按预算固定任务集,用于开发中…
- 02:19
- 02:14
研究:Claude Code 与 Codex 拦截监控可被注入攻击绕过
↗ 查看原文 · arxiv.org研究对 Claude Code 的 Auto Mode 和 OpenAI Codex 的 Guardian 做红队测试…
- 9 月 17 日 02:0001:56
- 01:39
DeepSeek-V4.1 Flash 技术报告:极限压缩 KV Cache
↗ 查看原文 · zartbot.github.io技术报告显示 DeepSeek-V4.1 Flash 主打 KV Cache 压缩,借鉴 YOCO 使 Prefill…
- 9 月 17 日 01:0000:41
SIFT:用快速树搜索降低编码代理自我改进成本
↗ 查看原文 · arxiv.org新框架 SIFT 引入 LLM 评判对候选补丁做两两比较,用 Bradley-Terry 模型聚合胜负记录指导树搜索,仅…
- 00:05
LLM-as-an-Improver:把验证反馈用于生成更优候选
↗ 查看原文 · arxiv.org论文提出 Verify–Repair–Reselect 方法,利用验证反馈修复最优与次优答案并生成新思路候选,再重新筛选…
- 9 月 17 日 00:0023:16
DASE 查询引擎加速非结构化数据多步推理检索
↗ 查看原文 · arxiv.orgDASE 引擎支持多属性过滤、多向量搜索与关系连接联合执行,在科学发现类工作负载上比主流数据库与向量库基线快 6 至 4…
- 9 月 16 日 23:0022:10
HarnessTax:编码 Agent 的框架影响有多大
↗ 查看原文 · harnesstax.github.io一项名为 HarnessTax 的研究探讨编码 Agent 中框架(harness)对最终效果的影响程度,试图量化这部分…
- 9 月 16 日 21:0020:59
论文提出 BITCOS,突破三值 LLM 1.58 比特存储下限
↗ 查看原文 · arxiv.orgarXiv 论文测量 29 个三值 LLM 发现零权重占比最高达 51.5%,据此提出 BITCOS 布局,在 29 个…
- 20:54
TrioRAG:无图多模态 RAG 推理提速 1.6–2.3 倍
↗ 查看原文 · arxiv.org研究者提出 TrioRAG,用问题、锚点图像和 VLM 增强查询三路信号在共享多向量索引上独立检索并做后期融合,省去构建…
- 20:15
- 20:10
AutoTuring 实验:AI 智能体是否真懂计算机架构
↗ 查看原文 · arxiv.org研究者用 AutoTuring 把同一 15 维加速器空间分别以具名架构参数和匿名变量呈现给同一智能体,以差值衡量“理解…
- 9 月 16 日 19:0018:13
- 9 月 16 日 18:0018:00
- 17:56
研究对比 ChatGPT、Claude、Grok、DeepSeek 联网搜索行为
↗ 查看原文 · arxiv.org研究结合真实用户交互与 API 受控实验,考察四个对话平台调用联网搜索的决策、查询策略、结果域名偏好及回答生成。发现各平…
- 17:46
Flag Game:群体可解释性的玩具模型
↗ 查看原文 · arxiv.org研究者提出 Flag Game 玩具模型,用隐藏国旗与局部观察的智能体交换信念,复现了群体信念崩溃与极化等现象,并提出社…
- 17:26
- 9 月 16 日 17:0016:55
- 9 月 16 日 16:0015:59
- 15:51
ReFigBench:把论文配图重建成可编辑 PPT 的评测基准
↗ 查看原文 · arxiv.org研究者发布 ReFigBench,基于 arXiv 论文的 1000 张真实综述图,评测多模态编码智能体把图片还原为可编…
- 15:19
ProgramDistill:从可交互网页生成可验证 SWE 任务
↗ 查看原文 · arxiv.org研究者提出 ProgramDistill,通过交互参考应用来发现功能并自动构造 4063 个可回放验证的编程任务。
- 9 月 16 日 15:0014:31
面向 AI 的防篡改决策记录,锚定 RFC 3161
↗ 查看原文 · dev.to一篇技术文章介绍为 AI 决策记录提供防篡改机制,并锚定到 RFC 3161 时间戳标准,背景是欧盟 AI 法案第 12…
- 9 月 16 日 13:0012:57
PACT:企业 AI 助手在压力下能否守住合规规则
↗ 查看原文 · arxiv.org研究者推出 PACT 基准,覆盖 12 个受监管企业领域、48 个多轮场景,测试 LLM 智能体在用户施压时是否违反既定…