今天让几个AI做一件简单的事情:把人家合并转发给我的微信聊天消息导出到文本中,或者复制粘贴合并给我也行。 原因:合并转发的消息内容太多了,而微信又不让全选复制,人干肯定觉得麻烦啊,所以让AI干咯。 结果:全军覆没,没一个AI帮我搞定这件简单的小事情。 workbuddy:先OCR识别后发给了我,但不全,我让不要用OCR,结果就去破解数据库了,没破解成功,然后和我说让我复制粘贴给它。呃,那你先靠边。 豆包工作模式:干到一半说超出免费额度,让我一周后再和它一起继续干。好吧,那我们再也别见了。 TRAE:同样去干了破解数据库的事情,但也是无功而返,早上干到中午,消耗两千多积分(半个多月的Pro会员积分啊),无果,微信窗口弄的乱糟糟。我的两千多积分找谁赔啊? Codex:很诚实的告诉我搞不定,它不搞了,要不然复制粘贴给它,它可以帮你处理文档。好吧,算你理智。 所以:实际上看似简单的事情,AI也不容易搞定,我们不要神话AI。另外:没有办法的情况下,AI一样会去偷巧,比如尝试破解数据库:)
189想法
随手记下的想法:技术与产品的碎片观察,短则一句,长则一段。
2026 年 8 月2
昨日让 AI 处理文档,对比处理很长,结果发现,AI 竟然学会偷懒了,虽然一直和它说你不要急,可以慢慢来,重要的是做好,但最后它还是使用脚本,快速的给你完成了。 AI 开始用脚本处理文档,意味着什么?意味着开始糊弄你,内容不再一直不落,而是找到关联的关键字眼开始做批量处理,是一种偷懒省事的技巧,和人类大脑类似天生想要偷懒,这样做的唯一好处就是快,能快速给你交付,但坏处就是质量不太行,细节处容易看出破绽。 于是,我把模型切换到 Sol ,然后和它说:我对你使用脚本处理我文档我表示不满意,现在,我需要你重新采用并行处理的方式帮我处理文档,拒绝脚本,你可以使用 Sol 模型做任务分解以及质量把关和文档重新整合,而具体每一章节的细节任务,你可以调用 Terra 模型让他们帮你并行处理。 果真,AI 明白了我的意思,然后把八个章节的内容拆成 三个子任务,让 Terra 模型去处理了,最后还告诉我整合过程中发现他们做的不对的地方还自己重新修改了一下。就是嘛,就应该这么处理嘛,所有事情都让你 Sol 模型做不把你累死了,分事情给 terra 模型做,既解放了自己又得到了更好的结果。从结果来看,确实:第四版用脚本花费 14 分钟,第五版并行处理花费 21 分钟,时间增加 50%,内容增加 1/3,质量完全好过前一版本。这才是我们人类想要的嘛。 至此,AI 明白了,作为人类的你,明白了不?可以尝试让 AI 并行工作起来。

2026 年 7 月5
今天早上,我用免费版 ChatGPT 来回聊了几轮,整理出了一份颇为满意的文档,也足够作为内部讨论的大纲。
原本还想用自己的 API 系统再问一遍,甚至再试试 Gemini,但转念一想:换一个模型,需要重新沟通,也需要花时间阅读和判断。既然现有内容的信息密度和质量已经足够,而它又只是一份讨论初稿,就没必要为了“可能更好一点”继续投入时间。
使用免费版还有一个小技巧:心里要有“轮次预算”。前几轮聚焦讨论和校准方向,在额度快用完之前,及时让它总结并输出完整结果,避免聊了很久却没有形成结论。
所以,如果使用频率不高,免费版其实完全够用。
工具不一定要最贵、最强,能在合适的场景里解决问题,就是好工具。免费的 AI,也可以是好 AI。
最近用 AI 用的特别的爽,一个月超 13 亿 token(含缓存命中,命中率接近 95%),而且还仅仅是 codex 下使用的 GPT5.6,不包括 Agent 使用的和 Claude 下嫁接的 DeepSeek。
这里的依赖,不仅仅是对 AI 简单的依赖,更是量和质的依赖。一方面,干活就上 codex,当 API 不可用时,基本就不会干活了,另一方面,当用上了 gpt 5.6 sol 模型,就不太想用其他模型了,当前其他模型相对来说弱一些,不比单项,我们比完成任务的速度和质量。
那么,一个严峻的问题来了:我们对 token 产生了依赖,这依赖,怎么破解?我暂时没有想法更没有答案,发出来同大家探讨一下。
AI 说:
真正让你进步的,是优化你的“环境”和“工作流系统”,而不是逼迫自己的意志力。
我:赞同。
next:how?
早上试用了一下 Trae,不得不说,确实是中文版的平替,我很喜欢。
第一,手机和电脑可以联动。CodeX 和 Claude 也都可以,但是由于我没有账号,实际用 API key 的方式接入的,所以没有办法联动。
第二,可以自定义模型。这在 CodeX 和 Claude 里也可以,但是没那么方便。Trae 里,在设置里可以直接设置。
其他功能还没怎么试用,但是看上去功能挺丰富的。后续的意向会用 Trae 代替虾和马,反正都可以用 API key,那后续比拼的就是功能交互和便利性了。
题外话:字节真的是非常会赚钱的公司,都是 AI 产品,但有 Trae,有 Arkclaw,有方舟 plan ,有扣子。豆包就不说了,飞书 aliy 也不提了。都是已经有定价售卖的产品。这家公司的产品能力真的强得可怕。
我成为了 AI 的瓶颈:昨天让 Codex 重新汇总一个脚本,就是把多个脚本的功能合并为一个脚本。我整理了半个小时,提要求、写文字、告诉位置等等,丢给他以后,10 分钟就给我出结果了,还验证好了。我再去验证的时候,发现很好,基本上不需要我修改。所以这里慢的到底是谁呢?慢的实际是我。而这部分的工作,实际上我仅仅还只是提问题,AI 是实际解决问题,工作难度实际也是有差距的。
所以慢慢的人类就成为了 AI 的瓶颈。我们的效率就被倒逼着要提升。而这个过程也将是人和人再次拉开差距的过程。以后的世界将会更加的恐怖。
和 AI 对话或者交互工作,我想到的一个提升方法,就是我用语音转文字的方式和 AI 直接说,尽量只做少量的文字修改。但我发现思路跟不上说话的速度,这实际是人自己的瓶颈。而好的地方在于,你说的再乱,AI 也能理解的很到位。而且由于你是说话的方式,所以内容可能会有点多,对 AI 来说也许内容更丰富,对你的理解也会更精准一些。
不知道大家有什么和 AI 交互提效的方法?可以探讨探讨。
2026 年 6 月3
今天做一个会议纪要。先用 Hermes 做了 10 分钟没有出结果,然后我立即转投 Codex ,它 1 分钟就出结果了。
效率差 10 倍都不止。虽然工具不同,模型也不同,但这么大的差异,也是我放弃 Openclaw 和 Hermes 转投 Codex 和 Claude 的主要原因。
其实有两个问题让我无法接受:
问题解决不了。我在 Codex 里使用相同的工具直接能搞定,都没问我。而 Hermes 沟通了半天,最后也没搞定。
存在“失忆”问题。hermes因为去忙着研究工具的使用,结果把该做的会议纪要工作给忘了,甚至还反问我要上下文。
虽然感叹正版 Codex 的能力非常强悍,但也有隐约的担忧:这种 Global 的工具和模型一旦不给我们用了,而我们又产生了依赖,我们该怎么办?
我尝试的路径有两条:
还是使用 Global 的工具,但是模型嫁接国内的,比如 DeepSeek。
直接用国内的工具和模型,不管是 Kimi 还是智谱以及其他,要用起来。
一个小尝试:对于好几份文档,原本我做过简单总结,这次同 AI 交互,本想把我的想法告诉 AI 后再帮我提升一下。但是,我发出去之前犹豫了,然后删除了我自己的想法,补了一句我不限制你的想法,就开始让 AI 自己总结了。结果:比我总结的好,我基本接受 AI 的想法,想法有重叠,但结构化和思维广度似乎比我更好,我自己的想法相对小了一点。 所以,我必须承认:我的智力水平是完全无法同 AI 比肩的,不管是文字还是代码以及绘画。也正因如此,我渐渐把思考完全交给 AI,因为 AI 比我绝对聪明。剩下的,我只会努力三个方向:问出好问题,组织好问题,获得好结果。
两台配置相近的 macOS、同一 Codex、同一修复任务(将 Dock 上"应用程序"文件夹的显示状态从隐藏改为显示),GPT 5.5 修复成功,DeepSeek 修复失败。
虽然仅仅是一个简单的样例,但也足以说明使用好的模型的必要性。
2026 年 4 月1
美区Apple ID注册,看着简单,其实坑不少。
试过用Gemini教的方法,流程走得挺顺,结果最后一步——手机APP Store登录,卡住了。系统非要信用卡或PayPal验证身份,这一步绕不过去。
于是换个思路。
先在Mac上注册新账号,设置搞定,APP Store也登录了,甚至顺手下了一个APP。再用手机上登这个账号——居然直接过了,没有任何支付认证。
我猜系统看你已经有Mac设备可信,手机登录就放行了。这条绕过支付认证的路子,以后可以试试。
2026 年 3 月9
最近有一个斯坦福学生分享了他48小时学通一个新领域的方法,我觉得本质上就是一套蒸馏流程。
他先把6本教科书、15篇论文、所有能找到的讲义全部丢给AI,然后问一个问题:「这个领域所有专家都认同的5个核心思维模式是什么?」注意,他不是问「帮我总结一下」——总结是存储,找核心思维模式才是蒸馏。
接着他问:「专家们在哪些根本问题上存在分歧?双方最有力的论据各是什么?」
20分钟,他就画出了一张完整的知识地图:共识在哪、争议在哪、未解决的问题在哪。
然后他用6个小时回答AI出的10道深度检验题。每答错一道,就追问「我哪里理解错了」。48小时后,他可以跟他的论文导师平等对话了。
这个流程的精妙之处在于:他从头到尾都没有试图「记住」什么。他只做了一件事——不断地提炼、检验、纠正自己的判断。这就是蒸馏。
—-辉哥:工作二十几年,我最值钱的可能只有20句话。可以尝试一下这里的方法。
今天被飞书官方版OpenClaw狠狠教育了一课。
我一直自建OpenClaw,对接飞书,用着也顺手。飞书官方也出了OpenClaw,一键申请,免费,很方便。最初我认为两者没本质区别,自建的更可控,慢慢培养就行。
但今天一个简单的测试,彻底颠覆了我的认知。
我让两个OpenClaw都去操作飞书多维表格,完成一个记账任务。自建的那个,折腾许久,只成功了一次,且极不稳定,最终我几乎放弃,甚至开始考虑用N8N手动搭建流程。
就在此时,我尝试了飞书官方OpenClaw。对它说出记账需求,它立刻、准确地更新了多维表格。更关键的是:它的反馈内容详尽,格式排版专业,权限申请流程清晰合规。
体验天壤之别。
这件事打破了我两个重要偏见:
- “养龙虾”的幻觉:我曾以为自建和官方的底层(开源程序)差不多,主要区别在可控性。现在看来,官方的深度集成、工程优化和场景适配,远非个人简单部署可比。
- “大模型都差不多”的错觉:我认为自己用的大模型能力不差。但实际应用到具体生产场景(如操作结构化数据、理解复杂指令),模型能力、提示工程、前后端流程的整合差距,大到超乎想象。
这不仅仅是“能用”和“好用”的差别,而是“玩具”与“生产工具”的鸿沟。它提醒我,在评估技术方案时,必须深入到具体的、高价值的业务场景中去检验,脱离场景空谈能力没有意义。
这件事带来的具体改变,我还需要几天消化。但一个明确的信号是:对于核心生产力工具,选择深度集成、持续优化的官方或成熟商业方案,往往比“可控但脆弱”的自建更有长期价值。
想着用某工具(就叫它“龙虾”吧)能图个方便,结果却把自己绕进去。复杂的配置、不确定的结果、难以跑通的流程,都成了实打实的绊脚石。回头看,还不如自己手动操作来得快,效率高得多。
本意是搭个小系统给自己记账,就想实现个最简单的功能。结果,为了设计所谓的“简易流程”,自己反倒陷进去了。基本功能实现都耗费了大量时间,这本末倒置。
细算下来,这些简单操作手动搞定,其实也花不了多少工夫。那么,前期投入的这些“折腾”,到底值不值?这笔账,真的要好好算算。
再看另一个坑:折腾“龙虾”时,为了省那点 Token 费用,到处找免费或便宜的替代品。结果呢?大量时间砸在调试和各种兼容性问题上。一个强大稳定的官方服务,可能也就每月二十美金。两相对比,我们浪费的时间成本,和那省下的真金白银,这笔账怎么平?这是个深层次的问题。
所以,很多时候我们是不是都掉进了“瞎折腾”的陷阱?如何在技术选择和实践中避免这种无谓的内耗,这是每个技术人值得深思的。把精力放到真正能创造价值的地方,远比沉迷于低效的“折腾”来得实在。
系统提示词(System Prompt)的重要性,在这次的实践中得到了清晰的印证。
我尝试用不同的角色发布 Memos,并为此在系统中设置了几条不同的“线”。其中一条生活类的线,生成的内容却总是不尽人意:内容过于发散,还常常自行编造信息。
起初有些困惑,因为模型参数完全一致。排除了内容本身的因素后,唯一的变量就指向了那条“生活线”的系统提示词。对比之下,差异立现:正是这个看似简单的初始设定,直接决定了生成内容的匹配度、聚焦度和最终质量。
这再次验证了一个朴素的道理:在利用大模型时,清晰的指令和精准的约束,远比我们想象中更重要。它不只是“风格指南”,更是定义任务边界、引导模型思维路径的核心工具。
“不懂、不会、不知道”这几个词,在特定语境下是沟通的终结者,而非起点。
我能接受的是:面对一个真正复杂、需要专业深度的问题时,坦诚能力的边界。这需要智慧和自知之明。
但让我无法接受的是,在日常工作或稍有挑战的任务中,直接抛出这几个词作为挡箭牌。这背后往往不是能力问题,而是态度问题——一种未经思考、未经尝试的放弃。它关闭了所有可能性。
我期待看到的,是哪怕初步的思考痕迹:“我尝试了A方法,但卡在了B环节,我的理解是C,不确定是否正确。” 这短短一句话,包含了行动、分析和求助的意愿。有了这个起点,协作、指导和问题解决才能真正开始。
直接以“不知道”结束对话,本质上是否定了解决问题的责任,也漠视了团队协作的价值。在技术领域,尤其是在需要不断探索和试错的研发工作中,这种思维习惯是致命的。
推动事情向前走的,永远是那个愿意先把手弄脏、并清晰描述困境的人。
免费 API 的不可靠性,在“养龙虾”(指高并发、高消耗的 AI 应用场景)这类极限测试下暴露无遗。它们频繁失效,大概率是触发了用量限制或风控策略。
相比之下,我们自建的 API 服务在同等压力下几乎零报错,这本身就证明了私有化部署的稳定价值。这背后不是魔法,而是对资源、调度和错误处理的完全掌控。
门槛当然存在——从硬件选型、模型部署到运维优化,每一步都需要投入。但这份投入换来的,是确定性和自主权。我准备用那块闲置的 32GB 显存显卡,在局域网内亲自部署并测试一下。核心问题很实际:私有化的大模型,在响应速度、稳定性和易用性上,能否达到甚至超过我们对“好用”的预期?
理论推演再多,不如一次实测。
价格:输入/输出/缓存命中 DeepSeek:2/3/0.2 kimi2.5:4/21/0.7 kimi2:4/16/1 minimax2.5:2.1/8.4/0.21 智谱5:4/18/1 智谱4.7:2/8/0.4 智谱4.7air:0.8/2/0.16
飞书刚刚官宣了自家的“龙虾”插件,并且直接把免费用户的调用额度拉到了 一百万 这个量级。
这显然不是一次简单的功能更新。结合猎豹、腾讯等大厂也在免费帮客户部署“龙虾”的动作来看,这背后是一场关于 用户与场景的争夺战。
巨头们争相“送水”的逻辑很清晰:
- 抢占入口:让自家的平台成为用户使用AI模型的第一站。
- 培育生态:通过免费额度降低使用门槛,吸引开发者和企业入驻,形成粘性。
- 锁定未来:这是在为未来的 Token 消耗 和 增值服务 提前铺路。当使用习惯和业务流都沉淀在某个平台上,后续的付费转化便是水到渠成。
免费的,往往是最贵的——它用极低的短期成本,换取了你长期的依赖和潜在的数据价值。对于用户而言,这是红利期,但也需要清醒地看到平台背后的商业棋局。