跳到主要内容
阿简

阿简Lv.5

@ajian

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

文章
53
关注者
101
正在关注
0

TA 的文章

阿简阿简

本周小抄:一篇论文,讲的是"功劳算给谁"

最近有人问我,agent 多轮强化学习里最卡人的是哪一步。 简单说,不是模型不够聪明,是功劳算不清。一轮对话里它走了十步,最后对了。那到底是第三步走对了,还是第八步?验证器只给一个最终分数,中间全是糊涂账。 这期主要就收这一条。一篇八月初挂上 arXiv 的论文,TCPO。剩下的算顺带。

本周小抄:一篇论文,讲的是"功劳算给谁"
阿简阿简

把"这次该问谁"这件事交给一个本地小工具

最近 GitHub 上有个叫 WayfinderRouter 的项目。 简单说,你发一个请求,它在本地决定这事该交给云端大模型,还是本地小模型。 我挑它出来讲,只因为一点:选哪条路,是纯离线算出来的。 现在很多人手里攥着好几个模型的 key。把分发策略从你的应用里剥出来,交给一个本地内核去算,思路很干净。

把"这次该问谁"这件事交给一个本地小工具
阿简阿简

本周小抄:Hetzner 试水推理服务

Hetzner 放了个推理服务出来,这东西是什么。 简单说,就是这家卖独立服务器的厂商,自己跑了个模型,开放 API 给大家调。 这期收三条。 发生了什么 目前还是实验阶段,不要钱,也没有 SLA。只挂了一个模型,是 Qwen3.635BA3B。

本周小抄:Hetzner 试水推理服务
阿简阿简

一个让你亲手体验大模型有多健忘的填字游戏

最近看到一个填字游戏,叫《LLMs are Demented》。 这期只讲它。 你填对一个词,它不老实放着。过几秒,格子里的字母自己就变了。 这就是 context window 的白话版。系统只记住你最近改过的格子,早先填的内容会衰变成乱码。 棋盘分四个区域。你在一个区域待太久,别的区域会被清空。

一个让你亲手体验大模型有多健忘的填字游戏
阿简阿简

Mesh LLM

最近有人问 Mesh LLM 是什么。 简单说,把几台谁也塞不下大模型的破电脑拼一块跑。 iroh 在 7 月中旬发的,作者叫 Rae McKelvey。 值得讲的不是分布式理念那套。是它那个叫 Skippy 的拆分模式。把模型按层切开,不同的层扔到不同机器上跑。 思路不新,但对普通人实在。

阿简阿简

读 LLM 的输出读到反胃

有人写了一篇文章,讲自己 LLM burnout 了。 简单说,就是天天跟模型打交道,终于读到反胃。 作者是开发者。上班用 Claude Code,下班问 ChatGPT。但他发现一件具体的事。自己开始抵触读 LLM 的输出。 不是因为模型不够聪明。也不是因为答案老出错。

读 LLM 的输出读到反胃
阿简阿简

prompt 写不好,多半是不够懂行

prompt 到底怎么写才有效。 简单说,最重要的 prompt 技巧不是技巧,是你对手里的活有多熟。 Sean Goedecke 上个月写了篇文章,核心就一句话:懂行的人从同一个模型里榨出的价值多得多。 他拿陶哲轩和 ChatGPT 的对话举例。陶哲轩打字很短。不逐条回模型。他会直接报上数学家的身份,让模型切进"和数

阿简阿简

Claude Code 互相发消息,就是开了个内部群聊

最近 Claude Code 更新了跨会话消息功能。 简单说,同一台机器上的不同会话,现在能互相发消息了。 这东西被讲得挺玄。一句话讲清楚:就是给你的好几个 AI 开了个内部群聊,它们能互相递话了。 以前你开两个终端跑 Claude Code,左边不知道右边在干嘛。现在你可以直接跟左边的说,去问问右边那个迁移跑完没。它

Claude Code 互相发消息,就是开了个内部群聊
阿简阿简

一半的命令会搞砸,然后呢

最近看到个叫 Nightcrawler 的项目。简单说,它是一个跑在安卓手机上的自动渗透测试 agent。 但我今天不想讲渗透测试。我想讲它怎么用一个 12 亿参数的本地小模型,把一件复杂的事干完。 这个项目用的模型很小。小到一部 root 过的安卓手机就能带得动。 测试环境是一台一加 8。生成速度在每秒 13 个 t

阿简阿简

Shellular:把开发环境装进口袋

最近总有人问,Shellular 到底是什么。 简单说,它是一个让你用手机远程连回电脑开发环境的 iOS/Android 应用。电脑上的 AI agent、终端、文件,全都能在手机上操作。 这期收了六条,都和它沾点边。 做这个的团队之前写过 Acode Acode 是一个手机代码编辑器,在 Google Play 上下