Grok 4.7 上線了,跑分還小勝 Opus 5:先恭喜效率變好,也順便看一眼盯著螢幕的你
從 Grok 4.7 上線並在 CursorBench 跑贏同檔模型的消息出發,聊聊追模型更新與跑測試的你在用眼、作息與資訊判讀上可以怎麼被照顧。
開發者社羣這兩天又熱鬧了。xAI 的新旗艦模型 Grok 4.7 已經在部分平臺上線,上下文長度來到 50 萬 tokens,支援文字與圖片輸入。在 CursorBench 這個程式輔助評測上,Grok 4.7 的 Extra High 模式拿到 46.3%,些微高於同檔競品 Opus 5 Extra High 的 46.1%,而單任務成本大約只有對方的一半。聽起來像是一則單純的科技新聞,但如果你是那種會立刻打開終端機、改參數、跑一輪測試確認的人,這則新聞其實也和你今晚的身體有關。
先把新聞本身讀懂:那 0.2% 代表什麼
CursorBench 是 Cursor 團隊用來評估模型寫程式能力的基準測試。46.3% 對上 46.1%,差距是 0.2 個百分點。值得留意的是,Cursor 自己就有說明,這類分數存在波動,接近的分差不一定有統計意義。這句話很誠實,也值得你記下來:跑分接近的時候,排名的意義遠比看起來小。
真正對你有感的差異,反而是成本。同樣跑 Extra High 等級的任務,Grok 4.7 折算單任務約 6 美元,Opus 5 Extra High 約 11.4 美元。如果你的日常工作流程本來就重度依賴這些模型,換一套可能讓你少跑幾次帳單警報。
另外有個技術細節容易被忽略:要把推理強度參數 reasoning_effort 設為 xhigh,預設的 high 對不上那一檔成績。這也提醒我們,任何跑分都是在特定配置下測出來的,換個參數,結論可能就不一樣了。這種「看起來客觀的數字其實有前提」的素養,和我們之前聊過的AI 突然不能用時的身心反應是同一門功課:工具在變,你的判斷力才是那個不變的底層。
跑分追新聞的夜,你的眼睛正在做什麼
模型更新的消息,幾乎都發生在你該睡覺的時段。美國時間的下午,正好是臺灣的深夜到凌晨。於是很多人的人生劇本是這樣的:睡前滑到消息,想說看一下就好,接著打開電腦、貼 API key、跑測試,一抬眼已經凌晨兩點。
長時間盯著終端機和文件,最先抗議的是眼睛。乾、癢、視線偶爾模糊,這些是典型的數位視疲勞訊號,和 長時間盯螢幕調圖的用眼照顧裡聊過的狀況同源。你可以用一個很舊但仍然有效的方法:二十分鐘看近,就移開視線看六公尺外的東西二十秒。麻煩,但眨眼次數會回來,淚膜也比較不會破。
肩頸是第二個受害者。測試跑起來之後,人會不自覺往前傾,脖子前伸。等 API 回應的那幾十秒,正好是把肩胛骨往後夾、下巴往內收的好時機。不需要起身做操,光是這兩個小動作,就能讓肌肉記得自己原來的位置。
什麼時候該停下來:幾個身體的提醒
大多數熬夜追更新的疲勞,睡一覺就會好。但有幾種狀況值得你多一分警覺。
如果你發現自己連續好幾天都在凌晨一兩點後才睡,白天靠咖啡撐、注意力明顯下滑,這已經是作息紊亂的訊號,下一步可以把「看模型消息」設定時間上限,或者乾脆把手機的社羣通知在晚間十一點後關掉。
如果眼睛的乾澀痛持續超過幾天,或者出現畏光、疼痛、視力突然變差,就不要再點人工淚液硬撐,掛個眼科讓醫師看一下角膜狀況。多數是可處理的小問題,早看早安心。
如果胸悶、心悸伴隨著焦慮感反覆出現,尤其是那種「不確認完所有更新就放不下」的緊繃,這比較接近壓力反應了。可以做的下一步是把測試清單寫下來,告訴自己明天再跑,然後做幾分鐘的慢呼吸。寫下來這個動作本身,就能把盤旋的念頭從腦中挪出去。持續未改善的話,家醫科或身心科都是合理的求助對象。
資訊判讀:這類消息你需要記住的三件事
第一,跑分網站給的是相對參考,當分差在波動範圍內,它更像一場勢均力敵的比賽,不是一場革命。第二,成本數字要看計價方式。同一家服務可能分不同分組、不同倍率,輸入、輸出、快取讀取各有單價,直接拿兩個總數相比可能失真。第三,親自用你自己的實際任務測,永遠比看別人的排行榜準。你的工作負載和測試集不同,結果自然不同。
這也和之前寫過的收到警報當下的身體反應與判斷有個共通點:越刺激的消息,越需要慢半拍再行動。慢的那半拍,保護的既是你的判斷,也是你的睡眠。
工具升級了,把你的休息也升級一下
模型每幾個月就換一代,跑分每幾週就洗一次榜。今天贏 0.2%,下個月可能又被反超。在這個循環裡,唯一不會被版本號迭代掉的是你的身體。
如果這則新聞真的讓你想試試,好,把測試排在你精神最好的時段,白天跑,效率高,也不耽誤睡覺。跑完記下結果就好,不需要和整個網路一起即時反應。
工具越來越強,是好事。而你把自己照顧好,才有本錢一直用下去。