MiroFish 做不到什么
每个 AI 预测产品都有局限,但几乎没有谁把它写出来。以下是我们的局限,包括对我们不利的那几条:24 个智能体只是样本,不是总体;智能体是语言模型,不是真人;我们从未把预测结果与真实发生的事对照评分;而且模拟智能体意见一致并不能证明判断正确。
如果这些让你觉得这个产品没有预期中有用,那正是应有的结论——我们宁愿你在这里就得出它,而不是付费之后。
撰写者 Zinedine · 发布于 2026 年 8 月 27 日
硬性局限
24 个智能体是样本,不是总体
一次运行会依据你的场景生成 24 个利益相关方,让他们进行 3 轮互动。这足以呈现反应的范围以及会扩散开来的论点;但远不足以把市场、选民群体或客户群当作统计总体来建模。
请把输出当成一屋子了解情况的人在争论你的决定,而不是一份问卷调查。如果你需要知道四万人会怎么做,它能告诉你他们大概会搬出哪些说辞,而不是其中多少人会真的行动。
硬性局限
智能体不是真人,他们的引述也不是证据
每个智能体都是被赋予角色和利益的语言模型。他们从没买过任何东西,没取消过订阅,也没有因为涨价而恼火。他们是在推演这样的人会如何反应,这和真的是这样的人并不相同。
报告里的引述是生成的,不是收集来的。它们的用处是让你预演将要面对的异议。绝不能把它们粘进演示文稿当作客户原话、当作调研引用,或展示给可能误以为是真实反馈的人。
硬性局限
我们从未把预测与真实结果对照评分
这是我们最不喜欢、而你最该掂量的一条。MiroFish 的报告带有概率,但我们没有校准数据:没有把历史预测与实际结果逐一核对的存档,没有实测命中率,也就没有任何依据说“70%”真的十次里对七次。
在那之前,概率只表达模拟的这屋子人如何分歧,而不是经过验证的预测。任何人若为这类工具报出准确率——无论是我们的还是竞品的——报的都是没人量过的数字。
硬性局限
智能体意见一致并不等于判断正确
报告里的置信度在狭义上是真实的:它是最后一轮中持相同立场的智能体占比,而且确实会变化——我们实测过 42% 到 92% 的区间。它衡量的是这个场景在多大程度上一致地指向同一个方向。
它不衡量对错。二十四个智能体一致,可能意味着局面本就清楚,也可能意味着你的表述让某个答案显得理所当然。数字高,是提醒你回头检查是否诚实地描述了其中的张力,而不是可以停止思考。
值得了解
它会算错
语言模型是不可靠的计算器,报告有时会依据你给出的数字推导出错误结果。本站公开的一个示例把损失算成 6,000 美元,而正确答案约为 2,000 美元,我们把它原样保留而没有重新生成。
我们收紧了提示词,并且现在会自动校验其中一类错误:概率之和必须为 100%,每次发布前都用真实运行验证。派生出来的金额则不会自动校验。凡是你准备据以行动的数字,请自己核对。
硬性局限
你没告诉它的,它一概看不到
它不连接你的计费系统、CRM、分析工具、客服收件箱或合同。模拟只知道你提示词里的内容和你上传的文档,别无其他。
所以含糊的输入只会得到含糊的报告;也正因如此,写清两三个真实细节——具体的客户分群、具体的竞争对手、真实的数字——比你能做的任何其他事都更能改善输出。
硬性局限
它无法知道尚未发生的事,也无法知道尚未公开的事
危机中的决定性事实,往往是记者已经拿到而你还不知道的那份文件;发布中的决定性事实,往往是竞争对手尚未宣布的计划。任何模拟都触及不到这些,而一份忽略了它们却语气笃定的报告,只是既笃定又不完整。
正因如此,危机场景是最弱的一类,我们的危机页面直说了这一点:那里的置信度低于定价或发布类场景,而且本就应该更低。
值得了解
无论你用什么语言写,报告都用英文
你可以用任何语言提交场景,引擎都能理解,但报告会以英文返回。本站提供中文、西班牙文和法文;产品输出没有。
用英文以外的语言测试文案或语气,可靠性也明显更低:习惯用法和语域正是模拟解读最薄弱的地方。凡是准备投入预算的内容,请让母语者复核。
值得了解
底层到底是什么
运行使用 gpt-4o-mini。一次预测是 74 次模型调用:一次生成利益相关方,72 次智能体发言分布在 3 轮中,最后一次依据完整记录撰写报告。整个过程约 29 秒,我们的算力成本约 1.2 美分。
我们把这些公开,是因为不公开就等于让你想象成更宏大的东西。如果换个模型或更大的阵容会改变你订阅与否的决定,现在你有据可依了。
值得了解
一次运行可能比预期小,而且它会如实告诉你
如果某个智能体调用失败,该智能体会被丢弃;如果某一轮超时,报告就用已完成的轮次来写。报告上显示的智能体数与轮数,都是按真实发生的工作量统计的,所以运行不完整时数字会变小,而不是装作没事。
这是一处改动。在 2026 年 8 月 27 日之前,这些数字是随机生成的,与任何实际情况无关。我们换掉的是引擎,不是标签。
硬性局限
这不是专业意见
报告中的任何内容都不构成法律、财务、医疗或劳动方面的专业意见。凡涉及责任、监管披露、证券或劳动法,模拟至多是你带去与有资质、有执业保险的专业人士讨论的一项输入。
它也不能替代与真实客户交谈。如果你能问十个已经付费给你的人,先去问:那胜过任何模拟,包括这一个。
它真正的用处
读完上面这些,支持它的诚实理由是:这是一种快速且便宜的方式,让某个对你的决定毫无利害关系、也没理由客气的东西来反驳你。它会翻出你没想到的异议、反应方向与你担心的正相反的客户分群,以及你没在准备的第二天舆论角度——而此时改变方向仍然便宜。
这值三十秒和几美分。但不值得被当成预测。
常见问题
AI 预测准确吗?
任何在卖这类产品的人都无法诚实回答,包括我们。MiroFish 没有校准数据:我们从未把预测存档与真实结果对照评分,所以概率表达的是模拟的利益相关方如何分歧,而不是经过验证的命中率。任何供应商为这类工具报出的准确率,报的都是没人量过的数字。
MiroFish 实际运行多少个智能体?
每次运行 24 个,分布在 3 轮互动中——合计 72 次智能体发言,另加一次生成阵容和一次撰写报告的调用。作为观点样本,这足以呈现反应的范围;作为总体建模,则远远不够。
置信度高是否代表预测正确?
不是。置信度是最后一轮中持相同立场的智能体占比:真实、实测、并且逐次变化(我们观察到 42% 至 92%)。它衡量场景指向一致的程度,而不是答案是否正确。数字高也可能只是因为你的表述让某个答案显得理所当然。
报告里的引述可以当作客户调研使用吗?
不可以。它们由模拟智能体生成,不是从真人处收集的。它们适合用来预演你将面对的异议,绝不能作为客户原话呈现、作为调研引用,或放在可能被误认为真实反馈的地方。
MiroFish 能看到我公司的数据吗?
不能。它不连接你的计费系统、CRM、分析工具或合同,只知道你提示词中的内容和你上传的文档。所以写清几个真实细节,比其他任何做法都更能改善输出。
MiroFish 最不擅长什么?
危机预测,因为决定性变量通常是尚未公开的事实——往往是记者已经掌握的东西。其次是长期声誉变化:跨越数年的影响超出了几轮模拟所能估计的范围。这两点在相应页面上都写明了,不只写在这里。
发现了这里没有列出的局限,或本站别处有与此矛盾的说法? 告诉我们 ,我们会修改页面而不是回避意见。另见 一份标注了错误的真实报告 以及 我们公开的研究。
看完仍然觉得有用?先看看它实际产出什么,再决定是否付费。
阅读示例报告