实测Sakana Marlin:8小时自主调研出100页报告,深度研究该卷向”小时级”了
你做过行业战略调研吗?打开ChatGPT点一下”深度研究”,等20分钟,拿到十来页综述——读着挺像回事,真要拿去做百万级决策,总觉得”浅了”。6月15日,东京的Sakana AI交出了另一种答案:给它一个题目,它自己闷头跑最多8小时,最后交一份近100页的战略报告,还配好幻灯片。
Sakana Marlin是什么:一个被锁在房间里的”初级战略顾问”
Sakana Marlin是Sakana AI的首款商用产品,6月15日结束从4月开始的封测正式开卖。它的定位很直白——”虚拟首席战略官(Virtual CSO)”,目标客户是金融机构、大公司战略部、咨询公司、智库这类靠”调研—分析—写报告”吃饭的团队。VentureBeat有句话概括得很准:把它想成一个初级战略顾问,被锁在房间里,面前只有一块白板和互联网连接。
这家公司来头不小。联合创始人Llion Jones是Transformer架构起源论文《Attention Is All You Need》的合著者,”Transformer”这个词就是他创造的;另一位创始人David Ha来自Google Brain。公司2025年底完成B轮融资,估值超26亿美元,投资方包括Khosla Ventures、英伟达、谷歌、三菱日联、花旗和Salesforce。4到6月间,约300位各行业专业用户参与了封测,帮它打磨报告格式和质量。
8小时里它在干什么:树搜索+多模型调度+冲突消解
Marlin的底座是Sakana攒了两年的东西:一块是发过Nature的AI Scientist(自动化科研流程),另一块是拿过NeurIPS 2025 spotlight的AB-MCTS(自适应分支蒙特卡洛树搜索)。AB-MCTS听着唬人,干的事其实好懂:它把推理当成一棵树来搜,让好几个模型一起上,自己决定哪条假设值得继续追、哪条直接砍掉、哪条换个模型再试一遍。
底层会跨o4-mini、Gemini 2.5 Pro、DeepSeek-R1等多个模型动态调度——这等于承认没有哪一家前沿实验室能独占所有推理技能。多模型变体在ARC-AGI-2上解决了27.5%的任务,高于o4-mini单独的23%,底层算法已开源为TreeQuest。
那8小时不是空耗:一次会话里它要发起几百到上千次模型调用,反复试、反复推翻、反复重来。当两条分支返回相互矛盾的事实时,Marlin会调用AI Scientist子模块做冲突消解,带显式引用把矛盾reconcile掉。最后,被验证过的发现被组装成一份结构化报告和一份独立生成的幻灯片——两者都能追溯到来源URL,每份报告引用60到80个来源。
Marlin vs OpenAI/Perplexity/Gemini深度研究:不是一个打法
市面上的深度研究大多优化于分钟级推理,Marlin把”思考时间”当成产出质量的杠杆——跑得久,等于想得深,它不抢同一块地。
| 维度 | Sakana Marlin | OpenAI Deep Research | Perplexity Deep Research | Gemini Deep Research |
|---|---|---|---|---|
| 运行时长 | 最长8小时 | 5-30分钟 | 2-10分钟 | 5-20分钟 |
| 输出规模 | 60-100页报告+幻灯片 | Markdown答案 | 引用文章 | 结构化简报 |
| 目标客群 | CSO/战略部/咨询/智库 | 知识工作者 | 研究员/分析师 | 工作区用户 |
| 来源数量 | 60-80个 | 未明确 | 较多 | 较多 |
| 自主度 | 全程无人值守 | 半自主 | 半自主 | 半自主 |
| 价格 | 约9800元/次起 | 含在订阅 | 含在订阅 | 含在订阅 |
价格上分了几档:按量付费100积分/次、98元/积分(约9800元/次,折合66美元);Pro版15万元/月含2000积分(约1000美元/月);Team版40万元/月含6000积分(约2700美元/月);企业版定制。一次同等深度的战略咨询动辄六位数,Team版一个月能产出约60份报告,比一个初级顾问还便宜——这正是Sakana插进咨询行业的价格楔子。
优缺点:8小时无人值守,谁来兜底那几个错
优点:
- 时长杠杆独一份:把”思考时间”当质量杠杆,8小时级的长时自主研究目前没有直接竞品。
- 输出可上会:100页报告+配好的幻灯片,能直接进战略评审会,不用再排版。
- 多模型不绑定:AB-MCTS跨多家模型调度,哪家用哪家的强项,也降低单一供应商风险。
- 引用可追溯:60-80来源+AI Scientist冲突消解,每条结论能回溯到URL,不是凭空生成。
缺点:
- 藏得很深的AI错误:8小时无人值守产出的权威感报告,任何人都难逐条fact-check,错一个数代价不小。
- 价格门槛高:9800元/次起步,个人和小团队用不起,本质是B2B产品。
- 需要人工复核闭环:企业部署必须给每次运行加一个人工review检查点,”agent干活,但治理决定它能不能上线”。
- 长任务不确定性:8小时里网络抖动、模型限流、来源失效都可能让某条分支白跑,容错还在打磨。
适合谁:战略部/咨询/智库,个人先观望
如果你是金融机构、大公司战略部、咨询公司或智库,靠重型调研吃饭又最怕慢——Marlin值得认真评估,它可能是第一个真正动摇咨询行业成本结构的东西。如果你是个人或小团队做内容、做投研,先用OpenAI/Perplexity/Gemini的深度研究足够,等Marlin出现更便宜的按量档或免费试用再考虑。想了解”AI定时替你上班”的另一条路,可以看看我们之前实测的Grok Automations和吴恩达OpenWorker。
长时自主Agent的时代已经开局,”深度研究”正在从分钟级卷向小时级——这一次,卷的不是更快,而是更深。