lol
书名:这个男人来自地球|作者:笑无语|本书类别:古言|更新时间:15:41:01|字数:3896字
A | 作者|心怡 编辑|重点君 互联网大厂间的AI入口大战打到了桌面端。 AI摘要 开学季孩子作息紊乱,专家建议放弃强迫早睡,改为固定早起并限制午睡以积累困意。利用晨间光照和睡前调暗灯光调节生物钟,辅以温水澡、呼吸放松法助眠。若调整一周无效,应及时就医。

B | 开学季即将到来,可一些孩子还在暑期模式中,半夜不肯睡、上午叫不醒。如何让孩子早睡?福州市第二总医院神经精神病防治院心身睡眠科的赵丁主治医师就此给家长支招。 先说一条刚出炉的消息。据《财经》7月21日报道,阿里即将推出千问办公,把QoderWork、悟空、MuleRun三款Agent产品合并成,交给钉钉新任CEO陈宇森负责。 放弃“逼他早睡” 改为“叫他早起” “今晚9时必须关灯!”“把手机收起来!”“再不上床就揍你!”……这是许多家长在让孩子早睡时说的话。 不止阿里,腾讯也正把资源集中到WorkBuddy上,字节内部讨论把飞书和豆包办公深度整合。 赵丁医生介绍,其实大脑想不想睡,全看白天“攒了多少困意”。

C | 强迫一个还不困的孩子早睡,就像逼一个不饿的人吃饭。 信号很明确,持续半年的大厂Agent“赛马”结束,C端的入口大战刚歇,各家开始把资源集中到新战场:桌面Agent的入口大战升级了。他只会躺在黑屋子里瞎想发慌,越躺越清醒。 赵丁建议,把注意力放在“准时叫孩子起床”上。 目前战况如何?数据显示,WorkBuddy今年7月DAU已突破1300万,是国内用户活跃度最高的Agent办公产品。

D | 再看一组访问量数据,从六月桌面AI原生办公智能体的访问量看,腾讯WorkBuddy、阿里QoderWork排在第一梯队。哪怕孩子前一晚熬到凌晨,早上也要准时叫醒他,也别让孩子午睡超过20分钟,而要把困意全部攒到晚上。到了点,孩子的脑子自然转不动了。 四位选手各有来头。 WorkBuddy产品底座沿用打磨两年多的CodeBuddy内核,马化腾在财报会上直接称它是“中国使用最广的效率智能体服务”。 豆包专业版背靠字节自家的Seedream、Seedance,是四家里多模态弹药比较足的一个,但只跑自家模型、生态也有些封闭。 另外,家长可以利用光线,帮孩子的大脑找回节奏。据介绍,人体的生物钟其实在很大程度上受到光线影响。 百度搭子入局较晚但动作密集、持续升级,7月刚甩出个人版升级、企业版和“搭子联盟”三个更新。 清晨起床后10分钟内,带孩子去阳台或户外晒15分钟太阳。 QoderWork是阿里把Agent能力从代码搬到办公的产物,招牌是带下载量排行的技能市场和15套专家套件,即将要升格为“千问办公”的底座。这缕阳光就像“起床号”,能瞬间吹散身体里的残留困意。 一线城市机场和地铁的广告位上,大家都说自己是六边形战士。但用户更多只关心一件事:今天要选一款Agent,到底谁能真正干活? 这次,我们挑两个高频的真实工作场景,同一台Mac、同样的提示词、注册即得的免费档,把四家放到一起对比。

E | 晚上睡前1小时,让孩子尽量少看电子产品,尤其避免刷短视频、玩游戏等。 两个真实工作场景,看谁最能干活 两个场景各代表一类办公刚需,一个是重复操作型,考的是手勤不勤;一个是内容生产型,考的是脑子和手艺。 场景一:打开浏览器抓一批更新,整理成一张本地表格 事情不难,但是人工做起来真的很费事,能偷的懒还是偷一偷。

F | 同时,适当调暗室内灯光,让孩子逐渐进入休息状态。 因此,我们需要检查桌面Agent能不能自己“坐到电脑前”,把鼠标键盘用起来,从头跑完流程,最后交给我们一份能直接用的本地文件,而不是像问答AI只给到一个“你可以这样做”的方法。 睡前2分钟 让大脑慢慢“关机” 赵丁医生指出,很多孩子不是不想睡,而是脑子还在高频运转,根本停不下来。所以睡前2分钟,核心是给大脑“卸包袱”和“降降温”。 这样一来,权限申请顺不顺、过程看不看得见、耗时稳不稳,也都在观察范围内。

G | 我们给四位选手同一条提示词: 不得不说,用工具和测工具难的不是任务本身,整个过程很像做实验,环境没理顺,出bug总让人心里堵、想放弃。 家长可以通过洗温水澡诱发孩子的困意:在睡前一个半小时让孩子泡脚或洗个温水澡。

H | 洗完澡后,身体从热乎乎的状态慢慢凉快下来的过程,会给大脑传递强烈的困意信号。 WorkBuddy我们前几次就没测成功,细看发现它硬啃反爬、卡在无头浏览器安装上,Agent直接放弃,任务黄了。

I | 把床变成安全区:关灯前,绝不提成绩,不数落,更别问“开学你怎么办”。 下面的成绩,都是环境理顺之后的正式记录。 WorkBuddy老老实实地打开了openai.com/news,最终页面只渲染出9条,命令行curl又被反爬挡下(403)。别让孩子带着满脑子的防备和焦虑入睡。但这次它没一条道走到黑,转头找到官方RSS订阅源作为“最新更新”的权威口径,按时间倒序取满10条,在桌面生成了两张表:最近10条明细+Agent中文速览独立页,还自检了一遍链接可用。 全程花了约4分钟,但我好像被骗了。 此外,还有一种呼吸放松法可让孩子早睡:让孩子躺好,吸气4秒、憋气7秒,再慢慢呼气8秒。重复几轮,可让紧绷的神经放松。任务是33分启动、37分才真正跑完,但界面上的“完成时间”始终停在33分,有一点掩耳盗铃的意味。 测下来,腾讯WorkBuddy任务执行先受阻,然后靠RSS兜底把活干完。 百度搭子在任务开始前一次性申请权限、显示开始时间,执行时直接跳到默认浏览器,你能亲眼看着它滚动翻页取数,全程约4分钟。 如果调整了一周,孩子还是“昼夜难分”,说明睡眠节奏已经彻底乱掉了。产出10条,但摘要整列是英文、没做中文化,链接也被塞进摘要单元格,没独立成列。

J | 这时候应及时带孩子寻求专业的睡眠心理门诊帮助。(记者 陈丹 通讯员 林佳荔)。 测下来,百度搭子过程相对透明,速度也较快。 豆包的过程就比较偏黑箱,任务开始时不提示开始时间、网页滚动也不显示。

K | 最终产出10条,中文摘要的信息密度在四家里数一数二(带具体数字),也是唯一把“Agent中文速览”做进Excel独立页的一家。对照官方RSS时间序,它抓的这10条恰恰贴近字面的“最近”。 测下来,豆包摘要比较扎实,抓得也算准。 QoderWork选择走软件内置浏览器检索,约12分钟,四家里垫底。前期没有人工验证会一直空等;后期「真人验证」反复5次以上才过,交互比较磨人。

L | 产出结构还算规范,一共有7列、中英双标题、带分类与可点链接。比较糟糕的是把一条内容的日期认错成7-15,连带漏掉了真正7-15的新闻。 测下来,QoderWork结构规范,但慢、手动卡人机验证。

M | 同一句提示,四家抓出的“最近10条”并不重合(✓=命中) 有意思的是,这四家抓出的最近10条,只有四条对上了。 我们将四份产出并排一放,只有4条是四家共有的,其余各不相同。 分析原因发现不是谁抓错了,而在openai.com/news本身有两套顺序:默认卡片视图是编辑精选序,RSS是纯时间倒序。豆包和WorkBuddy落在时间序阵营,贴近字面的“最近”;百度搭子和QoderWork跟着页面卡片,贴近“人打开页面第一眼看到的”。两边都不算错,但好的Agent应该主动告诉你,它用的是哪种口径。 Agent能力测评,真正拉开差距的,不是谁点得漂亮,而是最后到底有没有把东西交出来。 百度搭子、豆包和QoderWork全程真机点击,自己一步步跑完;WorkBuddy一条路走不通然后就退回RSS抄道。 但说到底,桌面Agent能不能甩给我们一份打开就能用的文件,比它中间走哪条路重要得多。

N | 卡住的时候,肯绕路的往往比硬顶的更管用。 场景二:一句话,产出公众号+小红书+口播视频三件套 换个身份代入一下。假设你是个做AI的自媒体博主,或者给博主打工的运营。7月模型圈炸了锅,这波热度必须蹭。

o | Agent要先摸清楚这个月发生的时间,挑一个有爆款相的选题,一口气把公众号文章、小红书图文、数字人口播视频(还是很有难度的)这三件套全出齐。 这题评的是干活和交付的水准,模型新闻本身真假不核实。

p | 四家检索出来的核心事实高度一致,个别对不上的地方在点评里标出来了。 四款提示词一样: 四位选手,一个个上。

q | WorkBuddy一上来先建了个任务追踪,把活拆成盘点「选题→三件套→配图」,全程3分16秒,四家里最快。

r | 选题定的是《全球最大开源模型诞生——中国开源联军改写AI游戏规则?》钩子还不错,自带开源vs闭源的冲突感。 最亮眼的是公众号直接给了能渲染的HTML成品,头图压着标题,还甩出金句"美国卖铲子,中国发铲子还包邮",全文约900字,符合字数要求;小红书、口播稿、分镜表一样不落,4张配图风格还挺统一。唯一没跑完的是数字人成片(本机没渲染引擎),但它老实交代了,还主动给了个替补方案。

s | 测下来,腾讯WorkBuddy,快,省心,东西拿到手就能用。 百度搭子动手前先正经做了需求分析,交付前还查了字数、精简了两回。它检索的数据在四家里算细的,跑分、定价、股价波动,全都有出处。选题《七月AI大乱斗》,冲突和情绪拉满。公众号走的是深度分析路子,还多合成了一段TTS口播音频,下载途中代理挂了,它自己用curl绕了过去。 不过也做的差的地方,正文1510字,比1500的硬线多了10个字;成品是.md,不是能直接渲染的HTML。

t | 测下来,流程一板一眼,检索真的有点实力。 比赛的四家里就豆包一个命中了专门的自媒体写作技能,下笔前先把公众号、小红书、短视频分镜这些平台规范挨个读了一遍,干活的路数也像个老练的新媒体编辑。 细看发现检索面也广,光国产阵营就盘进来6家以上。 真正拉开差距的是专业度,公众号约1400字,附4个备选标题,还逐条核对了来源做内容验真;小红书连置顶评论怎么写、怎么连发矩阵、怎么回评都给了。配图里那张标着真实模型名的阵营对比图,是四家里最贴题的,另外还有数字人形象图和TTS语音。交付方式也独一份:所有成品写进一份飞书在线文档,复制就能发。毛病是头图有点文字错乱,思考独白啰嗦了些。 测下来,豆包算是一个学好规矩再动笔的学生。 QoderWork本次耗时约10分钟,属于比较慢的选手。选题“轮到闭源巨头睡不着了”,钩子合格,公众号约1480字结构挺整,小红书和口播稿也都有。真正栽跟头在多媒体:配图服务出故障,重试6次全败,图片生成失败,音频视频也没影。结尾反问了一句“需要我现在重试出图吗”,已经忘记我们“一遍跑通”的要求。

u | 测下来,这位选手属于是文字过关,配图有点糟糕。 图为:Agent耗时相对速度 配图和多媒体,这才是这道题真正拉开距离的地方。 三家成功出图、风格统一、拿来就能用:WorkBuddy出了4张,百度搭子3张配图外加一段TTS音频,豆包的图相对最对题、数字人形象也做得突出;QoderWork呢,颗粒无收。 图为:各家生成配图与多媒体成果对比截图 文字这关,四家都不错。

v | 真正把高下分出来的,是谁能带着编辑规范和运营策略,把成品直接交到你手上,能做到这步,Agent才算得上一个靠谱同事。 跑下来最深的一点感受是:东西能不能直接用,远比文字漂不漂亮值钱。飞书文档、能渲染的HTML,拿到手就能发;换成只丢给你一堆文字加提示词的,乍看挺齐全,真要落地,剩下的活还得你自己干。 多媒体是道硬门槛,出了岔子能兜住才算有实力。任务遇阻卡住了但肯绕条路把活交付,比闷头硬扛强得多,毕竟谁喜欢不能干活给公司憋大雷的同事呢。 价格:这笔账得单独算 实测下来,好消息是大家都给了免费额度,多数情况下跑个一两个任务是够用的。 我原本也是这么打算的,不充值,就当个普通用户,拿免费额度老老实实跑一跑,这样也更贴合大家平时的真实用法。结果谁知道,跑到豆包这儿就提示余额不足了,我只能咬牙充了68块把第二个任务跑完…… 所以话说回来,真打算重度用之前,还是建议先拿免费档把你天天要干的活跑一遍,看看积分烧得快不快,再决定这钱怎么掏。 谁会终结这场比赛? 两个场景跑完,没有全能冠军,但我们摸清了各位当下擅长什么。 WorkBuddy是快、省心的交付派。两场速度都在第一梯队,遇到卡壳会自己绕条路把活交了,东西拿到手就能用。

w | 短板在"亲手操作"这件事做得不够纯,计时这类小细节也不太细致。 豆包专业版是内容和多模态见长的质量派。场景二靠方法论赢了,场景一的摘要也扎实,自家的Seedream、Seedance撑着,图和音频都不掉链子。代价是全程看不见它怎么想的,生态也封闭。 百度搭子是过程透明的严谨派。权限一次给够,干活全程看得见,检索还带出处,两场都很稳。可惜两次都栽在最后一公里的打磨上。 QoderWork是货架摆得全、结构也规范的潜力股。文字底子不差,专家套件的思路也对。但两场都垫底,人机验证来回折腾,配图崩了也没救回来,眼下是四家里让人更操心的一位选手。 四家广告打得正凶,真正的胜负手根本还没露面。 这场比赛的玩法,也正在悄悄改变。 上半年整个行业烧钱烧出一条教训,Agent能生成,不等于活能交付。生成一快,复核、判断、担责这些得人来干的环节反倒成了堵点。 有研究说,自主编程Agent能把代码提交量拉高120%,可真正上线的只剩三成。就好比后厨切菜快了三倍,餐厅一天还是卖那么多桌。

x | 所以谁赢,现在下结论太早。对用户来说,想清楚最常干的那件事,拿免费额度把它跑通,再决定掏不掏钱。 我们测的时候,这几款产品几乎是一天一个样,功能天天在变,所以这回只挑了两个场景跑,不敢说测全了。 而且现在有个大趋势,各家Agent都在抢入口,Agent正从电脑桌面往手机上挪。

y | 一个方向是手机端和桌面的联动,你人在外面,用手机就能给电脑上的Agent派活,回头它在电脑那头默默把事办了。另一个方向更有意思,是往微信这种IM里钻,你在微信或者飞书里随手一句话,活就交出去了,连App都不用专门打开。 这俩场景眼下都挺热,可惜这次没赶上测,我们留到下一轮再看。



