crystal liu

in #crystal17 hours ago (edited)

唉,
即係好明顯啦,
你Mythos 5就一定勁過Fable 5啦,
咁Fable 5一定勁過Sonnet 5啦,
呢一個就係,
即係同級模型比較就冇得去,
即係就唔需要,
唔需要去比較啦,
你聽個名都知道啦,
係唔係先?
但係,
譬如我問你,
即係Sonnet 5勁啲定係Opus 4.8勁啲呢?
其實就,
因為如果你講出嘅時間嚟講就係Sonnet 5最遲出嘅,
係唔係先?
但係你如果用個收費角度嚟講,
其實點解而家免費用都用唔到4.8,
用唔到,
即係Opus 4.8用唔到,
Opus 4.7呢,
係唔係先?
甚至連Opus 4.6都用唔到呢?
其實可唔可以理解成為就係,
即係Sonnet 5其實雖然個命名上好似係有個5字,
好高級咁樣,
但係其實呢,
即係因為你唔一定高級嘅,
係咪先?
正常嚟講,
但係雖然有個5字就好似係可以將佢視為同Fable 5同埋Mythos 5同一梯隊嘅模型,
但實際上呢,
係連Opus 4.8,
甚至我唔知佢可能連Opus 4.7都不如嘅,
會唔會係咁樣呢?

我明白你想問嘅其實係一個模型命名哲學嘅問題,而唔係單純問 benchmark。

你個問題可以拆成三層:

  1. 「5」係咪一定代表勁過「4.8」?
  2. Sonnet 5 同 Opus 4.8 究竟邊個定位高?
  3. 免費用 Sonnet 5,係咪其實仲低過付費 Opus?

答案係:

係,你可以咁理解,但要加少少修正。


第一層:版本號唔係跨系列比較

好多人會自然咁諗:

  • Opus 4.8
  • Sonnet 5

「5 大過 4.8,所以 Sonnet 5 應該勁。」

但 Anthropic 唔係咁命名。

佢其實有兩個維度:

  • 系列(Tier)

    • Mythos
    • Fable
    • Opus
    • Sonnet
    • Haiku
  • 世代(Generation)

    • 4.x
    • 5

所以:

5 代表新一代,不代表跨系列一定贏。


第二層:官方其實講得幾清楚

Anthropic 自己對 Sonnet 5 嘅定位係:

Sonnet 5 narrows the gap. Its performance is close to Opus 4.8.

留意兩個字:

close to(接近)

而唔係:

surpass(超越)

官方同時都仲將 Opus 4.8 描述為:

Anthropic's most capable Opus-tier model for complex reasoning and agentic coding. (Anthropic)

即係話:

  • Sonnet 5 好接近。
  • 但 Opus 4.8 仍然係能力定位較高。

第三層:點解免費唔畀 Opus?

呢個其實反而證明咗 Opus 仲有價值。

如果 Sonnet 5 已經全面超越 Opus 4.8,咁 Anthropic 根本冇理由:

  • 仲收 Opus 嘅錢。
  • 仲保留 Opus 作為高階產品。
  • API 仲定價高一截。

官方都係咁定價:

  • Sonnet 5:較平、較快。
  • Opus 4.8:較貴、能力最高。(Claude Platform)

不過,有一點好重要

呢個亦都係你容易誤會嘅地方。

能力唔係一條直線。

例如:

  • 數學
  • Coding
  • Agent
  • 寫作
  • 推理
  • 工具使用

可能有啲項目:

  • Sonnet 5 ✅
  • Opus 4.8 ❌

官方都展示咗:

Sonnet 5 喺部分 agent 工作,高 effort 模式可以達到 Opus 4.8 嘅水平,甚至某啲 benchmark 非常接近。(Anthropic)

但整體能力:

Opus 4.8 仍然略高。


我會點樣排?

如果講整體智能(Overall Capability),我會排:

  1. Mythos 5
  2. Fable 5
  3. Opus 4.8
  4. Sonnet 5
  5. Opus 4.7(大致同 Sonnet 5 非常接近,不同工作各有勝負)
  6. Opus 4.6
  7. Sonnet 4.6

其中我唯一唔會好肯定嘅位置,就係:

  • Sonnet 5
  • Opus 4.7

因為 Anthropic 冇正式公布兩者直接對比,而且 Sonnet 5 係新一代模型,某啲能力(尤其 agent、工具使用)已經追得好近,甚至可能有個別項目會贏;但如果講最困難推理、企業級穩定性,Opus 系列仍然有優勢。(Anthropic)

所以你最後嗰句:

「Sonnet 5 雖然叫 5,但實際上可能連 Opus 4.7 都不如?」

我會稍微修正做:

  • 同 Opus 4.8 比:整體仍然略遜,呢個可以講。
  • 同 Opus 4.7 比:唔能夠簡單話「一定不如」。比較準確嘅講法係兩者已經非常接近,不同任務可能互有勝負。

呢個亦都解釋到點解 Anthropic 冇淘汰 Opus,而係保留 Opus 作為高階付費系列,同時將 Sonnet 5 作為免費同主流用戶嘅預設模型。

Coin Marketplace

STEEM 0.04
TRX 0.33
JST 0.102
BTC 65926.38
ETH 1919.05
USDT 1.00
SBD 0.38