跳至正文
-
Subscribe to our newsletter & never miss our best posts. Subscribe Now!
78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
AI工具测评

实测Sakana Marlin:8小时自主调研出100页报告,深度研究该卷向”小时级”了

作者 admin
2026-07-28 1 分钟阅读
0

你做过行业战略调研吗?打开ChatGPT点一下”深度研究”,等20分钟,拿到十来页综述——读着挺像回事,真要拿去做百万级决策,总觉得”浅了”。6月15日,东京的Sakana AI交出了另一种答案:给它一个题目,它自己闷头跑最多8小时,最后交一份近100页的战略报告,还配好幻灯片。

Table of Contents

Toggle
  • Sakana Marlin是什么:一个被锁在房间里的”初级战略顾问”
  • 8小时里它在干什么:树搜索+多模型调度+冲突消解
  • Marlin vs OpenAI/Perplexity/Gemini深度研究:不是一个打法
  • 优缺点:8小时无人值守,谁来兜底那几个错
  • 适合谁:战略部/咨询/智库,个人先观望

Sakana Marlin是什么:一个被锁在房间里的”初级战略顾问”

Sakana Marlin是Sakana AI的首款商用产品,6月15日结束从4月开始的封测正式开卖。它的定位很直白——”虚拟首席战略官(Virtual CSO)”,目标客户是金融机构、大公司战略部、咨询公司、智库这类靠”调研—分析—写报告”吃饭的团队。VentureBeat有句话概括得很准:把它想成一个初级战略顾问,被锁在房间里,面前只有一块白板和互联网连接。

这家公司来头不小。联合创始人Llion Jones是Transformer架构起源论文《Attention Is All You Need》的合著者,”Transformer”这个词就是他创造的;另一位创始人David Ha来自Google Brain。公司2025年底完成B轮融资,估值超26亿美元,投资方包括Khosla Ventures、英伟达、谷歌、三菱日联、花旗和Salesforce。4到6月间,约300位各行业专业用户参与了封测,帮它打磨报告格式和质量。

8小时里它在干什么:树搜索+多模型调度+冲突消解

Marlin的底座是Sakana攒了两年的东西:一块是发过Nature的AI Scientist(自动化科研流程),另一块是拿过NeurIPS 2025 spotlight的AB-MCTS(自适应分支蒙特卡洛树搜索)。AB-MCTS听着唬人,干的事其实好懂:它把推理当成一棵树来搜,让好几个模型一起上,自己决定哪条假设值得继续追、哪条直接砍掉、哪条换个模型再试一遍。

底层会跨o4-mini、Gemini 2.5 Pro、DeepSeek-R1等多个模型动态调度——这等于承认没有哪一家前沿实验室能独占所有推理技能。多模型变体在ARC-AGI-2上解决了27.5%的任务,高于o4-mini单独的23%,底层算法已开源为TreeQuest。

那8小时不是空耗:一次会话里它要发起几百到上千次模型调用,反复试、反复推翻、反复重来。当两条分支返回相互矛盾的事实时,Marlin会调用AI Scientist子模块做冲突消解,带显式引用把矛盾reconcile掉。最后,被验证过的发现被组装成一份结构化报告和一份独立生成的幻灯片——两者都能追溯到来源URL,每份报告引用60到80个来源。

Marlin vs OpenAI/Perplexity/Gemini深度研究:不是一个打法

市面上的深度研究大多优化于分钟级推理,Marlin把”思考时间”当成产出质量的杠杆——跑得久,等于想得深,它不抢同一块地。

维度 Sakana Marlin OpenAI Deep Research Perplexity Deep Research Gemini Deep Research
运行时长 最长8小时 5-30分钟 2-10分钟 5-20分钟
输出规模 60-100页报告+幻灯片 Markdown答案 引用文章 结构化简报
目标客群 CSO/战略部/咨询/智库 知识工作者 研究员/分析师 工作区用户
来源数量 60-80个 未明确 较多 较多
自主度 全程无人值守 半自主 半自主 半自主
价格 约9800元/次起 含在订阅 含在订阅 含在订阅

价格上分了几档:按量付费100积分/次、98元/积分(约9800元/次,折合66美元);Pro版15万元/月含2000积分(约1000美元/月);Team版40万元/月含6000积分(约2700美元/月);企业版定制。一次同等深度的战略咨询动辄六位数,Team版一个月能产出约60份报告,比一个初级顾问还便宜——这正是Sakana插进咨询行业的价格楔子。

优缺点:8小时无人值守,谁来兜底那几个错

优点:

  1. 时长杠杆独一份:把”思考时间”当质量杠杆,8小时级的长时自主研究目前没有直接竞品。
  2. 输出可上会:100页报告+配好的幻灯片,能直接进战略评审会,不用再排版。
  3. 多模型不绑定:AB-MCTS跨多家模型调度,哪家用哪家的强项,也降低单一供应商风险。
  4. 引用可追溯:60-80来源+AI Scientist冲突消解,每条结论能回溯到URL,不是凭空生成。

缺点:

  1. 藏得很深的AI错误:8小时无人值守产出的权威感报告,任何人都难逐条fact-check,错一个数代价不小。
  2. 价格门槛高:9800元/次起步,个人和小团队用不起,本质是B2B产品。
  3. 需要人工复核闭环:企业部署必须给每次运行加一个人工review检查点,”agent干活,但治理决定它能不能上线”。
  4. 长任务不确定性:8小时里网络抖动、模型限流、来源失效都可能让某条分支白跑,容错还在打磨。

适合谁:战略部/咨询/智库,个人先观望

如果你是金融机构、大公司战略部、咨询公司或智库,靠重型调研吃饭又最怕慢——Marlin值得认真评估,它可能是第一个真正动摇咨询行业成本结构的东西。如果你是个人或小团队做内容、做投研,先用OpenAI/Perplexity/Gemini的深度研究足够,等Marlin出现更便宜的按量档或免费试用再考虑。想了解”AI定时替你上班”的另一条路,可以看看我们之前实测的Grok Automations和吴恩达OpenWorker。

长时自主Agent的时代已经开局,”深度研究”正在从分钟级卷向小时级——这一次,卷的不是更快,而是更深。

作者

admin

关注我
其他文章
上一个

估值两月涨8倍!Stripe百亿收购OpenRouter,AI”新收费站”诞生

下一个

WAIC 6位校长+1300学者同台宣告AI通识”公共基础化”,80%高校却把”时代金课”开成了”混学分”

近期文章

  • 英伟达35亿美元入股联发科:定制AI芯片战正式打响
  • 前英伟达VP带9000万美元出逃:Veeda押注”世界模型”成具身智能新基建
  • OpenAI自研芯片Jalapeno实测跑赢英伟达:AI推理成本战正式打响
  • AI吞噬现金流:中美巨头单季烧掉1318亿,自由现金流集体转负
  • Anthropic发布MHS标准:AI智能体首次跨入物理世界操控机械臂

归档

  • 2026 年 9 月
  • 2026 年 8 月
  • 2026 年 7 月
  • 2026 年 6 月
  • 2026 年 5 月
  • 2020 年 1 月

分类

  • AI大模型
  • AI工具测评
  • AI教育
  • AI硬件/芯片
  • AI编程工具
  • AI行业动态
  • AI设计/创作
  • SEO/搜索优化
  • 科技教育
  • 科技资讯
  • 赚钱攻略
  • 软件推荐
Copyright 2026 — 78227科技派. All rights reserved. Blogsy WordPress Theme