Fable 5.1评测:创造力与表现力的新高峰

647

最近,Anthropic推出了Fable 5.1,紧接着各类第三方测试和用户体验分享纷纷涌现。研究人员展示了该模型在代码编写和视频制作方面的能力,令人惊叹的效果吸引了众多用户的注意。

在ARC Prize基准测试中,Fable 5.1取得了令人满意的分数,ARC-AGI-2达到了90.0%,ARC-AGI-1则高达97.5%。此外,每个任务的成本显著降低,ARC-AGI-2的费用为3.12美元,ARC-AGI-1则为1.40美元,成本相比Fable 5降低了32%。除了正式测试,许多网友迫不及待地体验了这一新模型,分享了他们的创作成果,其中最受欢迎的是一款马里奥风格的赛车游戏,仅凭一句提示即可完成。此外,还有用户用单幅截图制作了另一款赛车游戏,并用一条提示语构建了一个恐龙主题的生存游戏,包含了丰富的玩法和多小时的可玩内容。

宾夕法尼亚大学的教授Mollick指出,尽管Fable 5.1在长流程任务的判断力和审美表现上有所进步,语言表达仍显得有些“Claude味”。尽管如此,他也用该模型制作了一款复古风格的太空飞船游戏。同行用户测试也显示,Fable 5.1在细节表现上已经接近AAA游戏标准。 qy球友会官网

在对比Fable 5.1与Kimi K3的同一段视频制作中,虽然前者的细节更为优越,但出于成本考虑,有用户更倾向于选择Kimi K3。科技媒体Every进行了全面的测评,涵盖编码、写作和知识性工作等多个方面。结果显示,Fable 5.1的token效率达到了Opus 5的一半,同时在处理时间上也更为高效。在编程和长任务方面,它的表现依然保持了前作的优秀水平,但更为细致。

在写作和知识性工作表现的测评中,Fable 5.1在长篇文本创作,尤其在段落续写任务中的效果超过了以往评测的所有模型。同时,它的语言表达简化到了初中生水平,表现出更平易近人的风格。然而,Fable 5.1在设计能力上仍存不足,颜色搭配单一,且用户在设定限制条件时,常遇到无法精确满足要求的情况。

此外,该模型在高效模式下,会额外调用不必要的子代理去协助工作,需要用户在使用前做出明确的预算调整。根据这些测试结果,Every团队为Fable 5.1总结了适用场景的界限,特别是对于协同编程和实时调试等任务。 qy球友会官网

每次参加足球课程,我都能获得更多的专业建议和反馈,让我在短时间内提高了很多技术,感觉自己变得更加出色!...

每次参加足球课程,我都能获得更多的专业建议和反馈,让我在短时间内提高了很多技术,感觉自己变得更加出色!...