AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 9 日 09:0008:20
- 08:16
CGMIA:用成员推断攻击检测代码生成基准数据泄漏
↗ 查看原文 · arxiv.org研究者提出 CGMIA,通过影子模型构建成员与非成员样本,结合 CodeBLEU、编辑距离、测试通过率、困惑度及 Cod…
- 08:08
- 9 月 9 日 08:0007:58
NetArtifactBench:测试 AI Agent 能否修复网络实验记录漂移
↗ 查看原文 · arxiv.org该基准包含 52 个注入不一致的实例,考察 Agent 在修复记录矛盾的同时保留有证据支持的结论。
- 07:53
MTP 技术解析:Qwen 与 Gemma 的多 token 预测
↗ 查看原文 · dev.to文章解释多 token 预测技术,该技术让语言模型能一次预测多个未来 token,并提及 Qwen 和 Gemma 中的…
- 07:37
- 07:35
- 07:04
- 9 月 9 日 07:0006:57
Claude Code 夜间运行公司,13 个免费防护确保安全
↗ 查看原文 · dev.toClaude Code 被用于夜间管理公司,一个命令安装 13 个预执行防护,阻止推送主分支、无 WHERE 的 DEL…
- 06:50
CS-Guard:首个代码生成安全护栏基准发布
↗ 查看原文 · arxiv.org该基准包含 1000 条恶意代码生成提示、7 种越狱攻击、虚构场景攻击及 331 条代码到代码提示,评测 7 个模型上的…
- 06:50
开发者用 2006 年旧电脑进行 16 个哈希实验
↗ 查看原文 · dev.to一位开发者没有实验室或真实数据,仅用 2006 年的 Toshiba 笔记本进行 16 个哈希实验,回应了“无用”的质疑…
- 06:41
Pairit:支持人机协作实时实验的在线平台
↗ 查看原文 · arxiv.org研究者推出 Pairit,用户通过单个 YAML 配置文件声明实验图,包括页面、随机化、匹配、聊天、共享工作区、服务端…
- 06:38
- 06:37
QTGNN v2:用4量子比特电路替换图神经网络消息函数
↗ 查看原文 · dev.to开发者分享了QTGNN v2的构建日志,将图注意力网络中的消息函数替换为4量子比特量子电路,探索量子计算在图神经网络中的…
- 06:23
开发者开源 AI Agent 技能集合 SKILL.md
↗ 查看原文 · dev.to开发者创建免费开源 GitHub 仓库,提供可直接放入的 SKILL.md 文件,为 AI 编程 Agent 扩展技能。
- 06:16
XAgent:执行引导的智能体框架提升 GitHub 问题修复率
↗ 查看原文 · arxiv.org论文提出 XAgent,通过分析程序动态行为与额外上下文来定位和验证 GitHub 问题,在 SWE-bench-lit…
- 06:12
微调结合 KV 缓存重算,长上下文 RAG 精度与首字延迟双改善
↗ 查看原文 · arxiv.org研究提出在微调时考虑 KV 缓存拼接,并有选择地重算部分缓存。在 RULER 基准 124k token 输入下,得分比…
- 06:05
- 06:01
- 9 月 9 日 06:0005:33
CauterRule v0.2.0 发布,强化 Agent 规则防护
↗ 查看原文 · dev.toCauterRule 发布 v0.2.0 版本,现已在 GitHub 和 PyPI 上线。该工具旨在防止针对 Agent…
- 05:32
LangGraph 在107项数据工程任务基准测试中胜出
↗ 查看原文 · dev.to一项针对 LangGraph、CrewAI 和 AutoGen 的基准测试显示,LangGraph 在107项真实数据工…
- 05:20
实践:基于追踪的CI/CD捕获并重放生产智能体故障
↗ 查看原文 · dev.to文章介绍了一种追踪原生的CI/CD方法,用于捕获和重放生产环境中的智能体故障。该方法旨在提高智能体系统的可靠性和调试效率…
- 05:02
蚂蚁百灵发布金融增强模型Ling-3.0-flash-Fin
↗ 查看原文 · qbitai.com蚂蚁集团百灵推出首个金融增强开放模型Ling-3.0-flash-Fin,标志着AI开始进入真实投研工作流。
- 9 月 9 日 05:0005:00
- 04:59
Quote.Vote v2 RC2 发布,进入并行协作阶段
↗ 查看原文 · dev.toQuote.Vote 宣布 v2 RC2 发布,是其重建过程中的又一里程碑。项目方表示第七阶段已就绪,欢迎并行贡献者参与…
- 04:59
AI面临发现难题:能力隐藏于空白提示框后
↗ 查看原文 · mhacevedo.com文章指出AI采用的最大瓶颈是用户不知道其能做什么,能力被空白文本框隐藏。模板和上下文只能部分解决,核心问题在于用户需先知…
- 04:53
- 04:52
- 04:39
- 04:34
- 04:34
- 04:30
- 04:30
- 9 月 9 日 04:0003:58
- 03:49
OpenWorkProof更新:核心1.4.0与DeepSeek集成
↗ 查看原文 · dev.toOpenWorkProof发布核心1.4.0版本及首个DeepSeek相关更新,并介绍了当前可验证的功能。
- 03:39
SkyProduction联合通义万相推出Wan 3.0限免活动
↗ 查看原文 · qbitai.comSkyProduction与阿里巴巴通义万相合作,在8月28日至9月1日期间限时免费提供Wan 3.0模型使用。
- 03:37
Agent 钩子默认故障模式为 Fail-open
↗ 查看原文 · dev.toHandrail 作者指出,agent 钩子的默认故障模式是 fail-open,即失败时默认放行。这可能导致安全风险…
- 03:26
- 03:14
- 03:10
- 03:02
- 9 月 9 日 03:0002:35
- 02:31
开发者构建RWKV-7与KAN适配器,改写散文不改变事实
↗ 查看原文 · dev.to一位开发者创建了结合RWKV-7和KAN的适配器,用于改写文本,使内容更自然而不改变原意。此工具旨在提升散文流畅度,同时…
- 02:17
Claude Code无人任务失败主因:git push占64%
↗ 查看原文 · dev.to一项对72次无人值守Claude Code任务失败的统计显示,其中46次失败发生在git push环节,成为主要故障点。
- 02:15
- 02:14
- 9 月 9 日 02:0001:33
Phoenix V2 发布:AI 认知架构可记忆、情感与进化
↗ 查看原文 · dev.toPhoenix V2 作为 AI 认知架构发布,包含论文、代码和书籍。该架构旨在解决 AI 模型更新后丢失先前构建内容的…
- 01:32
OpenAI与Anthropic研究员辞职,指责AI竞赛不负责任
↗ 查看原文 · twitter.comJacob Coxon宣布从Anthropic辞职,此前在OpenAI和Anthropic从事预训练研究三年。他公开批评…
- 01:31
演示AI代理可观测性与评估:Strands、Phoenix与AWS Bedrock
↗ 查看原文 · dev.to文章介绍了在AWS上使用Strands、Phoenix和Bedrock进行AI代理的可观测性和评估,内容源自一次相关演讲…
- 01:26