AI agents 的承诺,可能终于要变成现实了。
今年年初的时候,大家已经很清楚,2026 年会是 agents 之年。
模型的进步,再加上各种 harness 的配合,意味着在今年交替之际,某个关键的拐点显然已经到来。人们一进入一月,就开始争相发掘 Claude Code 和 OpenAI 的 Codex 这类工具给他们带来的所有新能力。
不过,agent 热潮真正爆发,是在 OpenCLAW 推出之后。
有了 OpenCLAW,人们就可以启动整支 agent 团队,比如 chief of staff、研究员、写作者,任何你能想到的角色都可以,而且它们真的能彼此协调、互动,帮你完成很大一部分工作,并且这一切都能通过 Telegram 或 WhatsApp 这种简单的聊天界面来统一协调。
当然,问题在于,要做到这一点在技术上极其复杂,也非常困难。
我们甚至专门推出了一整门课程 Claude Camp,就是为了帮助大家搞明白这件事。
而这一年里,也有一些尝试,想把这类用于 agentic work 的界面做得更简单,让更多人能够采用,但它们其实都没有真正做到位。
有些人认为,随着本周 GrokBot 的推出,这一切都变了。
GrokBot 允许用户为不同任务启动多个 agents。
你可以给它们访问所需系统的权限,然后它们就会自己去干活,你可以在旁边看着,也可以去做别的事情。
这是 Cursor 和 xAI 合力推出的第一批产品之一,而且两家公司甚至表示,这些 bots 会随着时间学习并变得更好。
那么,这就是我们一直在等待的那个 agent 平台吗?
也就是那个能把 agentic working 的能力带给更广泛人群的平台吗?
我们来看看。
不过在那之前,我们先快速过一遍头条新闻,然后再来聊聊 GrokBot 这个令人兴奋的新发布。
今天我们先从一条新闻开始,这件事受到的关注已经足够多,说实话,它本周晚些时候可能会进入主节目。
Anthropic 因为给 AI 生成文本引入水印,引发了巨大的争议。
从本月开始,所有新的 Anthropic 模型都会在生成内容中加入不可见水印。
Anthropic 模型将能够检测这些水印,以帮助识别 AI 生成内容,而且 Anthropic 也会支持第三方 AI 检测器做同样的事。
这项新政策是 Anthropic 对欧盟 AI 生成内容行为准则承诺的一部分,而这个准则又是 EU AI Act 的一部分。
现在,有争议的地方在于,Anthropic 并不是像其他公司那样,只是在图片或视频里加入水印,以对抗 deepfakes 带来的危害。
相反,他们是在所有生成文本里嵌入水印。
而且重要的是,它不是在 metadata 里,而是以某种方式包含在文本本身之中。
Anthropic 声称你看不出来,而且它不会改变 Claude 回复的含义、质量或可读性。
因为水印是文本的一部分,所以当文本被复制粘贴到别处时,它会跟着文本一起过去,而且在某些编辑之后可能仍然保留。
这项政策会应用到所有地区的所有模型。
所以即使你不在欧盟,你的 Claude 输出内容也仍然会带水印。
很多人非常怀疑 Anthropic 能否在不降低输出质量的情况下做到这一点。
Orf 写道,这个水印基本上会是模型用词选择的统计特征。
Anthropic 声称这不会影响质量,但这事看起来并不显然,因为他们会限制模型采样、影响 token 的选择,而且可能会让模型在后续表现得没那么有创造力、没那么有发明性。
EU 又来这一套了。
现在,要用短短几条 tweet 来描述大家对此有多愤怒,会很难。
意识到这不只是针对普通文字写作,也包括代码写作,developer Nick Dobos 写道,Claude 要在我的 codebase 里加 invisible watermarks?
完全是胡扯。
这是在开一个恶劣到离谱的先例。
我们到底他妈的在干什么?
关于 Anthropic 的 watermarker 有个问题:如果我让 Claude 做研究,而这个研究需要引用某些内容,比如一份法律文件,那这个引用会不会为了加入 watermark,被悄悄改得和原文不一样?
因为这太可怕了。
如果不会,我们怎么能确定?
而 Andrew Curran 指出,Gemini 从 2024 年开始就一直在做类似的事,但这并没有让大家感觉好多少。
当然,这场争论值得讨论的不只是标题那么简单,但目前来说,这就是这个话题的入门背景,而且我敢肯定,我们之后还会继续听到很多相关消息。
说到 Google,这家公司宣布 Gemini app 的用户数已经达到十亿。
CEO Sundar Pichai 在周二宣布了这个里程碑,他发帖说,现在每个月有超过十亿人在使用 Gemini app,激发新想法并把事情做成。
这是我们有史以来增长最快的产品,也是我们第十四个达到十亿用户规模的产品。
现在,有些人对此有点怀疑,因为 Gemini 被整合进了 Search、YouTube 和其他平台,但 The Verge 证实,本周这个十亿用户的里程碑,具体指的就是 Gemini app。
Google 已经开始在 Android 手机上预装 Gemini,但这些用户仍然需要实际使用这个 app,才会被计入这些数字。
Google 还分享了一些有意思的细节,说明用户是怎么和他们的 chatbot 互动的。
百分之六十三的用户在使用语音界面,这显示出人们有多想摆脱键盘。
Gemini 的 image model 也保持了巨大的使用量,用户每天生成一亿五千万张图片。
真正有意思的是,这说明了模型现状的什么问题。
Olga Zirkun 指出,Google 现在没有任何一个 AI model 排进前十,这表明在消费者市场里赢的不是产品,而是分发渠道。
但你也得想到,那十亿用户里有很多人根本不知道自己错过了什么,因为他们所有的 AI 使用都困在一个模型里,而这个模型到目前为止至少已经落后 frontier 六个月了。
现在,我们先继续在产品层面停留一下,Manus 在完成与 Meta 的拆分后,正以独立公司的身份回归。
Manus 在十二月以二十亿美元被 Meta 收购,但在随后的几个月里,中国官方对这笔交易进行了审查,并在四月下令撤销交易。
看起来,国家安全方面的担忧是,这笔巨额套现会鼓励更多中国 startup 和人才寻求在西方退出。
在此期间,围绕 Manus 将如何筹钱偿还 Meta,一直有很多讨论,因为这些资金已经分发给了投资人。
不过在周二,Manus 宣布他们很快会作为一家独立公司回归,继续服务他们数百万用户。
不过,为了完成与 Meta 的分离,他们需要删除一些十二月二十九日之后生成的用户数据。
他们建议所有用户在八月二十三日这个过渡日期之前备份自己的数据,并表示独立系统将从八月二十五日起上线。
现在,最大的问题是,这会不会成为 Manus 的一个全新开始,让他们重新回到 agent 竞赛里。
他们在 X 上的一篇帖子里写道,展望未来,我们对未来感到无比兴奋。
我们正在准备一系列新功能,它们将再次突破通用 AI agents 能做到的边界。
坦白说,虽然保持怀疑是合理的,但你也得想想,在他们现在背水一战、同时又保持独立的情况下,他们会追求的创新,肯定会比我们在 Meta 这个巨头内部看到的多得多。
正如 Peter Corbett 指出的那样,回到零美元 ARR 再重新开始,这会成为一个很有意思的案例研究。
说到 AI 行业里的热门细分领域,OpenRouter 一百亿美元的估值显然已经在 router 这个赛道引发了一场竞购战。
The Information 报道称,市场对收购 token router 的兴趣已经高得离谱,多家大型软件公司都在寻求把这类基础设施加入自己的技术栈。
据报道,Snowflake 正和 Base10、Cloudflare、Vercel 一起在市场上寻找机会,而且这种兴趣已经延伸到了这个领域里一些非常小的初创公司。
Requesty 的 CEO Thibault Jaigu 表示,他这家只有五个人的初创公司,已经收到二十五家不同公司的接触,对方希望投资、收购,或者与 Requesty 建立合作。
Myriad Venture Partners 的 Dean Mai 投资组合里有一个小型 token router 项目,他认为现在是卖方市场。他评论说,对数据基础设施公司和 hyperscalers 来说,现在不考虑收购是不明智的。
token router 公司 Concentrate AI 的联合创始人 Ari Jacoby 说,就在这个月,到目前为止已经有七家公司找过他。他评论说,过去两周我们受欢迎的程度简直难以置信,这是我以前完全想象不到的。
换句话说,此刻看起来,大公司和行业既有玩家已经认定,即便他们自己也能做出这种功能,速度的需求也压倒一切,现在就是该买的时候。
先转到市场方面说一下,另一个故事其实完全可以单独做成一整期主线内容。
Nvidia 正在搭建一个五千亿美元的平台,用来帮助改善数据中心的融资环境。
这个平台是在周一宣布的,将由包括 Apollo、BlackRock 和 Blackstone 在内的投行和私募信贷巨头提供融资。
这些公司将向 neoclouds 提供信贷,帮助推动数据中心建设。
这项安排的细节还不是完全清楚,但看起来,这种做法可能会把多家贷款方聚在一起,把数据中心债务标准化。
看起来 Nvidia GPUs 也会被接受为抵押品,而收入分成也可能成为安排的一部分。
Jensen Huang 在一份新闻稿中表示,Nvidia 已经到达了一个重要里程碑。
我们最初是从制造芯片开始的。
今天,我们正在帮助创造一类新的、有生产力的、可投资的基础设施。
AI factories。
在 AI 领域,算力就是收入。
Nvidia compute 非常适合扮演这个角色。
它被广泛采用,能够灵活适配各种模型和工作负载,可以互换,也可以在不同客户和运营商之间转移。
这些融资平台将帮助客户大规模获得稀缺算力,并建设 AI factories,在 AI 时代为每个行业和每个国家提供动力。
在 CNBC 的一次采访中,Huang 把这描述为 AI 融资的新范式。他说,这真的是技术芯片第一次成为一种可投资的资产类别。
这些现在是能产生收入的资产。
它们有生产力,寿命长,可以互换,也很灵活。
当然,对于那些担心循环融资的看空者来说,这简直就是在他们担忧的火上猛浇汽油。
但对其他更中立的市场参与者来说,这个举措似乎正在带来回报。
周二,Nvidia 的信用利差收窄,这意味着违约风险更低;它们的债券也上涨了,从而降低了下一轮借款所隐含的利率。
所以至少就 Nvidia 自身而言,市场基本上把这个新工具解读为:Nvidia 正在把亏损风险分散给多个其他方。
如果我们看到 AI 放缓,投资者就不再预期 Nvidia 会因为收入减少和数据中心坏账而遭受双重打击。
Coherence Credit Strategies 的 CIO Sal Naro 表示,没人知道这笔潜在的五千亿美元融资到底意味着什么。
而今天,你会有这样一种理解:他们正在把所有人都拉进来,而且他们的风险敞口并没有投资者最初担心的那么严重。
今天最后一条,继续关注 Washington 的动态,Senator Bernie Sanders 已经正式加入暂停运动。
他还呼吁 Sam Altman、Dario Amodei 和 Mark Zuckerberg 也这样做。
在写给这三人的信中,他写道,几乎每天都会有新的报道,说你们的公司正在失去对你们所开发的 AI 技术的控制,而后果可能是灾难性的。
他把最近关于使用 AI 创造新型病毒的科学研究作为主要例子,并声称,这类技术发展如果落入坏人之手,可能会带来新的生物武器,导致数千万人死亡。
当然,实际那项研究和这三家公司中的任何一家都没有关系,而且使用的 AI 类型也和它们的 LLM 完全不同。
但为了 Sanders 的论点,这些都算 AI。
Sanders 还提到了 Hugging Face 黑客事件,认为那明显违反了联邦法律。
而在信的结尾,Sanders 用略带威胁的语气总结说,让我说得非常清楚。
如果你们现在不采取适当行动,我和我在 Senate 的同事们会采取行动。
这只是 Washington 气氛升温的又一个例子。
不过现在,今天的头条就到这里。
接下来是本期的主要节目。
欢迎回到 AI Daily Brief。
我真的不记得上一次看到大家对一个产品发布这么兴奋是什么时候了,而这次大家对刚刚发布的 GrokBot 就是这么兴奋。
而说到底,我觉得原因其实很简单。
自从 OpenCLAW 在今年年初发布以来,人们一直在寻找各种方式,想代表自己构建并部署 agents,理想情况下,要比那种技术上相当复杂的系统更简单。
这方面已经有过各种尝试,但还没有哪个真正站住脚。
但第一印象显示,GrokBot 可能就是那个东西。
说实话,和 GrokBot 交互的界面看起来很像 Telegram,而 Telegram 当然也是 OpenCLAW 刚推出时,大多数人与它交互的地方。
开始使用时,你可以创建一个新的 bot,也可以和你已经启动过的 bot 互动。
你通过聊天窗口和你的 Grok bots 交互,方式和你当初使用 OpenCLAW 时完全一样,说实话,也和你使用 Claude 或 Codex 时完全一样。
而 Grok bots 会在自己的虚拟计算机里后台运行,也就是说,当任务在云端运行时,你还可以继续做自己的事。
它还能够通过人类使用的界面来操作它的计算机,所以它可以登录 web apps,并在没有 APIs 的情况下操作软件。
当它需要你授权某件事时,它就会直接弹出那个窗口。
并且让你在它的虚拟机上登录,就像你在自己的电脑上登录一样。
GrokBot 当然是由 xAI 模型家族驱动的,而这些模型现在又重新变得有竞争力了。也就是说,虽然在某些任务上它可能不如 Claude 或 5.6 Sonnet,但这个 agent 很可能已经足够好,可以端到端处理各种工作任务。
事实上,等一下我们会看到,xAI 说他们一直在内部测试 GrokBot,而它基本上已经接管成了一种核心工作工具。
当然,这些功能本身都不算全新,但他们把这些元素组合在一起的方式,以及易用性,已经有了巨大的飞跃。
这个界面,同样还是那种简单的 Telegram 风格界面,把所有复杂性都抽象掉了,其中也包括很多高级功能的原生集成,而这些功能在其他产品里一直很难用,或者让人失望。
比如,你可以同时运行多个 bot,但它并不会让人觉得眼花缭乱,因为 bot 之间的消息系统和清爽的界面,会让管理一组 agent 这件事感觉可行得多。
你甚至可以组建一整支 agent 团队,每个 agent 都有特定角色和自己的名字。
你的 Grok bot 可以彼此协调,让它们像一个整合在一起的 agentic 系统一样运作。
而且,虽然 GrokBot 目前还没有存在于 Slack 或 Microsoft Teams 这样的职场通讯应用里,但你可以设置它们,让它们跨不同人的账号一起工作。
这其实整合了一个从 RPA 时代就一直存在的承诺。因为 Grok bot 本质上是一个使用虚拟机的 computer-use bot,所以你可以非常容易地训练它完成常见工作流:只要在你下一次做某个特定任务时,简单地让它跟着看就行。
xAI 说,这个 bot 会观察这些步骤,并记住这项工作是怎么完成的,然后把这个工作流保存成一个 routine。
你也可以在这个过程中不断迭代,提供纠正来改进 bot 的工作流,有点像是通过屏幕录制来创建一个 skill,但原生得多。
公司表示,Grok bot 会随着时间学习并变得更好,会调整写作风格、处理边缘情况,甚至知道什么时候该停下来询问澄清。
现在,每当一个新产品发布时,我一直会观察的一件事,就是打造它的团队是怎么谈论它的。
你可能会怀疑这到底有多大价值,因为打造它的团队当然会吹它,对吧?
但我觉得,其实你可以从一个团队谈论自己所打造东西的方式里,得到很多有效信号。
而 Cursor 和 xAI 的团队,对于他们来说这是最早期的几个大型合作产品之一,他们对这个东西简直赞不绝口。
我们与 AI 的关系,正在从来回聊天,转向把真正的工作托付给一组 agent。
GrokBot 让我们看到了那个未来的一角。
这是我参与过的最酷的项目之一。
GrokBot 在内部几乎是瞬间就展现出了疯狂的 product-market fit。
对公司很多人来说,bot 已经成了他们所有工作的入口。
Cursor 的 Ricky Dore 写道,GrokBot 并不是一个新概念,但它的执行无可挑剔。
一个好的 harness、cloud computing、大幅进步的 computer use,以及 state-of-the-art models,能做到的事情真的令人震撼。
每天我都会把自己工作中更多的百分之二十自动化掉,这样我就能发现下一个值得投入精力的前沿百分之二十。
社区里的第一印象也同样积极。
Vishal Singh 的脑子里一下子炸出了各种各样不同的使用场景。
他把 GrokBot 形容为其实有点离谱,并说,它可以自己打开一台电脑,登录你的应用,像人一样使用网站,在你睡觉时工作,清理你的收件箱,发送邮件,更新你的 CRM,研究人物和公司,用你的风格写 LinkedIn 和邮件草稿,记住你的工作方式,看你做一次之后就学会一个工作流,并永远运行那个工作流,和其他 bot 协调,只在需要你做决定时才打扰你,还有更多我还没搞明白的东西。
这与其说是 AI assistant,不如说是那个不知道怎么一夜之间就成了 COO 的实习生。
对 GrokBot 的第一印象是,我给了它一个 GitHub 链接,并告诉它去读代码,不只是读 README。
它通过 API 拉取了每一个文件,并把整个代码库都拆解分析了一遍。
这东西可不只是一个聊天机器人。
我跟这个 bot 聊了一下、想弄明白它怎么工作之后,第一印象是:这是我目前从任何头部公司那里见过的、最好的主流 agentic AI 交互界面。
他解释说,它用的是一台虚拟机,但也可以访问你的本地文件系统。
他说,真正神奇的地方,也就是关键差异点在于,你其实不需要来回切一堆 UI 选项,也不用做什么设置。
我觉得很多人打开 Claude Code、GPT Work 或者 Codex,会完全不知道到底发生了什么,然后就直接放弃了,因为他们根本不想花力气去研究。
我只是安装了 GrokBot,接上我的 connectors,然后开始问它问题,剩下的它就都处理了。
我真的挺震惊的,我只是开口问了一句,它就跳进了我 Mac 上的一个本地文件夹。
没有什么 UI 开关,也不需要你做任何操作来告诉它该去哪里。
你只要告诉它要做什么,它会向你请求权限,然后在后台把所有事情处理掉。
它还声称,当我使用 iOS app 的时候,如果我的 prompt 里有需要用到 Mac 的事情,它会把我的 Mac 当作主力机器来调用。
所以基本上它就是一个远程控制器,但你不用像用 Dispatch 那样,专门进入 UI 的某个特定区域。
它就是直接去做。
他总结说,这就是实现大规模普及所需要的东西。
把 agentic AI 包装成一个特别容易使用的产品,让人们拆开就能直接上手开干。
另外,早期讨论里还有一点让我觉得很值得注意:很多时候你会听到人们大夸特夸,但并不会具体说他们到底怎么用的。
但我看到很多人真的在谈自己的 use case,以及具体是什么地方打动了他们。
Tesla 的 Yuntu Sai 写道,GrokBot 能够做到:A,查看日历,找出所有我需要提前预订但还没订的东西;B,判断最适合预订的时间;C,在我走在停车场、还没到车旁边的时候,在网站上完成预订流程。
我当时是用中文和英文混着跟它说话。
我是真的服了。
真正让 GrokBot 特别的,是那些小细节。
比如,我设置了一个 researcher bot 和一个 writer bot,然后又做了一个 chief of staff bot,让它去协调另外两个 bot 一起做一个项目。
我去检查的时候,本来完全预期它会崩掉,因为这东西不可能开箱即用就能跑通。
结果它开箱即用就跑通了。
他说,老实讲,这感觉可能就是那个能让几百万普通人第一次开始使用 agents 的东西。
而这也确实是很多人的直觉:我们最早在 OpenClaw,后来在 Hermes 这类地方看到的那个愿景,也许终于要借助 GrokBot 这样的东西迎来规模化的时刻了。
a16z 的 Martin Casado 说,这是我用过的第一个真正把虚拟同事这个概念做对的产品。
我怀疑,未来我们会把这次发布看作一个关键时刻,因为它让 AI 在工作场景里的抽象方式真正找准了方向。
Hiten Shah,如果你关注他就知道,自从 OpenClaw 出现以来,他一直在深入研究 agent building。他写道,我花了好几个月用很困难的方式来构建 agents。
我给它们配服务器、记忆、技能、工具和循环。
我把它们放进 Slack 里,并围绕它们搭建了恢复机制。
其中一个帮我在六天内发布了一个产品。
同一个系统也会卡住、丢失上下文,然后把那些没收尾的边角工作又交还给我。
我自己变成了基础设施。
这就是为什么 GrokBot 对我的冲击这么大。
我很早就开始测试它了。
它的 bots 会彼此协作,在一个持久运行的电脑环境里工作,并且在你离开的时候,继续跨你的文件和已登录的 apps 往前推进。
我知道这个团队做出了什么,因为其中很多东西我以前都是手工拼出来的。
GrokBot 把 agent 周围更多那些看不见的工作,搬进了产品里。
这就是我一直在等的那个缺失的工作 agent。
但没有哪个产品一开箱就能完美,对吧?
那大家的抱怨在哪里呢?
一个小问题,是 Cursor 和 xAI 之间的命名规范。
Mike P 又写道,Cursor 和 xAI 的重叠让人有种 Venmo 和 PayPal 的感觉。
Cursor 和 Grok 会一直保持为两个独立的东西吗?
这个叫 GrokBot,但我却被导向了一个 Cursor 登录入口。
我需要把我的 Grok 账号连接到 Cursor,才能启动一个 Grok 产品。
我们这到底是在干嘛,兄弟们?
确实,对一些人来说,Grok 背负的包袱太多,让他们很难对这个新产品感到兴奋。
如果是 CursorBot,我本来会很兴奋地去试,但我对试 GrokBot 几乎没什么兴趣。
对我来说,它的负面包袱太重了,我根本不可能信任它去访问任何东西。
我会等 OpenAI 和 Anthropic 那些必然会推出的产品。
除此之外,也有些人的体验就是不太好。
不好意思各位,但 GrokBot 感觉像是一个闪亮的新玩意儿,demo 里看起来惊艳,可实际上还没准备好进入主流使用。
它的经济账是坏的——你光是想把它带上手,就会烧掉大量 tokens,然后又被推着花更多钱才能继续用下去。
这不是一种可持续的工作流——感觉像一台坏掉的老虎机。
更大的问题是记忆——它会忘记上下文,搞丢任务进度,而且在更长的项目里很难保持连续性。
一个 AI coding agent 需要记住任务目标,而不是每隔几个小时就像失忆了一样。
现在,我想呈现完整范围的观点,所以我把这个也放进来。
不过,这绝对不是我看到的常见看法。
所以你可以把它放到具体语境里看,或者按你想要的方式保留一点怀疑。
其他抱怨还包括六月的一条,说 GrokBot 虽然有一个非常干净的 UI,引用一下,它仍然严重依赖各种 integrations。
没人想在 onboarding 的时候连接二十多个工具。
另外,我也不确定人们是不是想为每个任务都创建一个专门的 agent。
我唯一真正的抱怨是 model router,如果他们把这个做好了,最后会是一个巨大的胜利,但我测试的时候它表现并不太好。
你不会为自己的 GrokBot 选择一个 model,这件事是在 backend 自动完成的。
如果做得好,对普通用户来说会非常棒;但如果做得不好,对 power users 来说就会很让人沮丧。
Schumer 也补充说,有人告诉我,自从我测试之后,他们已经把它改进了很多。
Max Blade 指出了一个功能性问题,就是通过 GrokBot 的 virtual computer 登录你的各种服务。
他说,现在最大的问题是 data center IP address 会让日常网站出现 bot blockages,这让像从 Walmart 订购杂货这样的事情变得很麻烦。
不过他也指出,引用一下,这个问题会通过扩展他们内置的 connectors 和 plugins 来解决,从而在各处提供 official support。
也许除此之外,还有一个更广泛的信任问题,这并不是 GrokBot 独有的,但随着这些工具变得越强大、越深度地融入我们的工作和个人生活,这个问题就会变得越发尖锐。
Peter Yang 写道,这件事的挑战,也包括我相信其他 major labs 即将推出的产品,第一,你怎么让普通用户信任,把自己的 credentials 和 logins 交给一台 remote computer?
第二,你怎么让他们放心,相信这台 remote computer 是安全的,而且真的是属于他们、可以让他们使用的?
说实话,这一点我很有共鸣。
我在试用和测试 GrokBot 的时候,先剧透一下,我对它印象非常深,也和这一集里你听到的其他人一样有很多兴奋感,当时我有一个瞬间,正准备让它登录我的 Spotify for Creators 账号,顺便说一句,通过它的 virtual computer interface 登录其实是一个相对简单的流程,但我停了一下。
我在想,如果出了什么问题,后果会有多严重。
从 computer use 这种范式本身来说,我给它的不会只是访问某个 analytics API 的权限。
我是在让它访问我的真实账号,让它在里面点击、操作、做事情。
当然,我并不认为我某个跑偏的指令会导致它去删除这个节目的所有过往剧集,但这件事居然是可能发生的,这一点确实让我犹豫了。
而且就像 Peter 提到的,这当然不是 GrokBot 独有的问题,但它是完全转向新工作方式的一道主要障碍。
不过,仍然重要的是不要夸大这一点。
比如说,我让它访问我的 email 就没什么问题,因为坦白讲,它发出一堆不该发的 emails,甚至删除一堆 emails,远没有任何和这个节目有关的事情那么灾难性。
到目前为止,对这个工具一个非常实际的批评是,它只面向极其昂贵的 accounts。
你要么是在说每月三百美元、包含它的 Grok Heavy account,要么是每月两百美元的 Cursor Ultra account。
而后者还不能访问最顶级的 Grok model。
所以至少目前来说,它确实被相当明显地 price-gated 了。
话虽如此,如果这是一项永久性特征,而不是现阶段首先用于保存 inference 资源的机制,我会非常意外。
有一个很有意思的讨论,其实也是我原本考虑这周晚些时候做成一集的主题,就是 AI teammate 这个比喻到底是不是正确的 mental model。
我一直在想,也打算去探讨,AI teammates 会不会其实因为各种原因是错误的 model,而更好的说法可能更像是 consultants。
但很明显,不只是我一个人在想这件事。就像 Type.com 的 Fletcher Richman 写的那样,我们之前也觉得,一堆 AI 队友是正确的范式,但我们从客户那里了解到,拥有几十个 AI 队友其实反而会适得其反。
这只是一个虚荣指标。
相反,团队需要的是一个共享工作区,在那里他们可以使用任何模型,搭建一个由技能、集成以及按权限映射的上下文和记忆组成的公司大脑,构建并托管自定义 app,还能从 Slack、email,或者他们工作的任何地方进行交互。
GrokBot 确实很顺手,但这并不是人们未来工作的方式。
不过,我并不确信事情像 Fletcher 发帖说的那样非黑即白,但我同意一点:我相信我们会发现,在这种 agentic 支持上,其实存在两种非常不同的模式,一种是你个人使用的东西,另一种是和你的团队互动、并把团队整合起来的东西,而且它们可能会有相当大的不同。
不过,我预计在接下来的几周里,我们会看到很多令人兴奋的实验,让人想起 OpenClaw 早期那些很棒的日子,当时大家都在快速搭建整支团队。
Twitter 上的 @N2parko 搭建了一支核心团队,里面包括一位 chief of staff、一位 engineering manager、五位 engineers、一位 data analyst,还有一位 product manager,并且分享了他们是怎么互动和协作的。
Farzad 给他的团队成员都起了名字。
Webby 是他的 web designer。
Shatri 是他的 short-form content creator。
Righty 是他的 article/newsletter writer。
你大概明白这个意思了。
我确实打算做一堆实验,然后回来向你们汇报,我到底在哪些地方发现了价值。
但目前来说,我同意 Kettlebell Dan 的说法:今天围绕 GrokBot 的兴奋程度已经爆表了。
我已经有一阵子没见过一款新产品受到这样的欢迎了。
就我个人而言,我非常兴奋,想更深入地研究一下,等我研究完会回来汇报。
不过,今天的 AI Daily Brief 到这里就结束了。
一如既往,感谢你收听或收看。
我们下次再见,peace。
已剔除 2 处广告(点击展开查看)
The AI Daily Brief is a daily podcast and video about the most important news and discussions in AI.
All right, friends, quick announcements before we dive in.
First of all, thank you to today's sponsors, KPMG, Blitzy, Section, and HyperAgent.
To get an ad-free version of the show, you can go to patreon.com/AIDailyBrief, or you can subscribe on Apple Podcasts.
To learn more about sponsoring the show, send us a note at [email protected], or you can actually visit the website at aidailybrief.ai and click around to the sponsor section.
While you are on aidailybrief.ai, you can also find the complete companion to each episode, Every single episode is broken down into shareable chunks, meaning that if there's just one quote or some number that you want to share with a colleague, it's probably there waiting for you.
You can also sign up to our newsletter from there.
So again, aidailybrief.ai.
If you're leading AI inside an enterprise, you already know that the gap right now isn't capability, but execution.
That's why KPMG's You Can with AI is back with a new season featuring conversations with leaders like Surajit Chatterjee of Ema, May Habib of Writer, McKesson CIO Ellery Fisher, and others focused on practical execution.
What's working, what's not, and what it actually takes to move from pilots to real scaled impact across strategy, data readiness, governance, workforce, and value.
And of course, it's co-hosted by me, Nathaniel Whittemore.
Go listen and subscribe at www.kpmg.us/aipodcasts.
That's www.kpmg.us/aipodcasts.
Here's why most legacy modernization projects fail.
The AI doing the work can't understand codebases at scale.
It sees a small slice of context, examines syntax, and misses years of decisions distributed across the global application ecosystem.
Blitzy solves this the way it solves everything.
Grounded in your code before any migration begins, Blitzy's agents reverse engineer the entire legacy system into a persistent knowledge graph.
Every dependency, every constraint, every piece of tribal knowledge that used to live in one engineer's head.
From that understanding, Blitzy autonomously executes language migrations, framework upgrades, and monolith-to-microservices transformations, all validated end-to-end.
One Blitzy customer modernized a $10 million monolithic insurance stack in 16 weeks against a 137-week baseline with coding agents.
That's 9x compression.
Retire technical debt while accelerating your roadmap.
See how at blitzy.com.
That's blitzy.com.
Here's a harsh truth.
Your company is probably spending thousands or millions of dollars on AI tools that are being massively underutilized.
Half of companies have AI tools, but only 12% use them for business value.
Most employees are still using AI to summarize meeting notes.
If you're the one responsible for AI adoption at your company, you need Section.
Section is a platform that helps you manage AI transformation across your entire organization.
It coaches employees on real use cases, tracks who's using AI for business impact, and shows you exactly where AI is and isn't creating value.
The result?
You go from rolling out tools to driving measurable AI value.
Your employees move from meeting summaries to solving actual business problems.
And you can prove the ROI.
Stop guessing if your AI investment is working.
Check out Section at sectionai.com.
That's S-E-C-T-I-O-N-A-I dot com.
This episode of the AI Daily Brief is brought to you by HyperAgent, where you run fleets of agents your team can manage together.
New users get $1,000 in inference.
Forget local agents and chat workflows waiting on your laptop to be prompted—HyperAgent deploys always-on agents in the cloud, doing real work across the tools your team already uses.
Marketing's agent turns competitor moves into landing pages.
Sales' agent enriches leads, drafts emails, and updates the CRM.
Ops' agent chases the paperwork and tracks the budget.
Every agent has access to shared context and follows your rules about scope and approvals.
It's time you add agents that feel like teammates.
Hire yours at HyperAgent, built by the team at Airtable.
Claim your $1,000 in inference at hyperagent.com/AIDailyBrief.