久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

作者因官方賬號被封被迫使用Claude API中轉站,自研驗證工具測試后發(fā)現(xiàn)高價中轉模型摻水嚴重,行業(yè)透明度極低。 ## 1. 困境:剛需Claude但官方賬號接連被封 作者深度使用后確認Claude在長文邏輯處理等能力上遠超其他模型,屬于不可替代的剛需,但4個原價Max賬號接連被封,新Mac mini賬號也被秒封,只能轉用第三方API中轉站。 ## 2. 行業(yè)現(xiàn)狀:中轉模型完全黑盒,高價也無法保真 市面中轉站標注倍率從0.3倍到2.0倍,普遍認為0.3倍是逆向模型,2.0倍是正經Claude Max號池貨源,價格差距極大:一次文書工作0.3倍僅需約5毛錢,2.0倍需要15-30元。但高價2.0倍模型體驗飄忽不定,效果時好時壞,無法確認背后是否為真Claude,用戶花高價仍要擔心交智商稅。 ## 3. 市面驗證方法全部失效 目前社區(qū)常用的三種驗證方法都靠不住:直接問模型身份,隨便換個系統(tǒng)提示詞就能造假;用特殊提示詞套特征,當前中轉站已經可以輕松應對,方法早已失效;號稱能檢測的在線網站15秒就能跑完檢測,原理上根本不可能測出模型的知識正確率和綜合能力。 ## 4. 自研驗證工具的設計思路 作者不追求直接判定真假,改為用公開舊題庫做對照測試:找10個GitHub高星項目整合出726道覆蓋高考題、推理、數(shù)學、語言、編程的測試題,支持OpenAI和Anthropic兩種接口,答題后自動判分輸出加權的MCS分數(shù),還支持AI自動重答被截斷的題目,避免格式問題導致評分失真。 ## 5. 測試結果:高價中轉模型分數(shù)不如更便宜的DeepSeek V4 Pro 穩(wěn)定靠譜的DeepSeek V4 Pro最終得分為66.76分,跑完全部726道題成本不到10元,耗時不到1小時。兩家被推薦的、自稱正經Claude Opus 4.8的中轉站,2.0倍倍率模型得分分別為59.73分和51.55分,推理、數(shù)學、編程能力得分遠低于DeepSeek V4 Pro,跑題成本分別為35元以上和近20元,因為API不穩(wěn)定耗時近2小時,再次印證了十幾秒檢測的在線工具完全不靠譜。 ## 6. 工具說明與行業(yè)痛點 這個初級版本工具僅能做參考,無法100%判定模型真假,因為官方核心題庫不對外公開,且驗證需要花費1小時以上、30-50元成本,普通用戶門檻很高,但當前Claude中轉行業(yè)連初級驗證標準都沒有,消費者花真金白銀卻無法確認買到的模型是什么,這本身是極不合理的現(xiàn)狀。
我做了個測試Claude API 中轉站的Skill,測完發(fā)現(xiàn)水太深了
2026-06-05 18:57

我做了個測試Claude API 中轉站的Skill,測完發(fā)現(xiàn)水太深了

本文來自微信公眾號: AI Humanist by杉森楠 ,作者:杉森楠,原文標題:《我做了個測試 Claude API 中轉站的 Skill,測完發(fā)現(xiàn)水太深了》


昨天一個朋友給我起了個稱號,叫「Claude科學家」。



這個稱號的獲得,說出來nm一把辛酸淚。我的Claude官方訂閱已經被封了四個原價的Max賬號,最近又新買了一臺Mac mini,剛用幾天又被秒封。


封號封到我懷疑人生。


但問題是,Claude確實沒法替代。你只要深度用過一段時間,就會發(fā)現(xiàn)它在文字質量、上下文理解、尤其是一篇長文章的邏輯處理上,遠超其他模型。這種差別,真不是玄學。


所以就陷入了一個困境:我必須用Claude,但我已經徹底用不了Claude。


怎么辦?只能去找中轉站。


中轉站我用了兩個月。過程中發(fā)現(xiàn)一件事:這東西完全是黑盒。你根本不知道接入的模型,背后到底是哪個。然后,我就被當狗騙了。



市面上有一些推薦中轉站的網站,倍率標注得清清楚楚。低的0.3倍,高的1.8倍、2.0倍,看上去很透明。但你根本看不懂這倍率到底代表什么。



根據(jù)我長期使用的觀察,0.3倍率說是用Kiro逆向出來的Claude,2.0倍率說是正經Claude Max號池接出來的。聽起來后者肯定更靠譜。


我一開始也這么想的。畢竟倍率差了快七倍,價格擺在那,總不至于拿假貨糊弄人吧。


我日常完成一件文書類型工作,走完一套工作流,用0.3倍率的平臺,大概要花5毛錢,但是走2.0倍率的平臺,一次就要花15到30塊錢。而2.0倍率的Claude API,一般意義上,大家會有個共識,那就是正經的Claude Max號池接出來的API。


但用了一段時間之后,我發(fā)現(xiàn)了一件很微妙的事。有時候覺得挺聰明的,有時候又覺得不太行,心里始終沒底。這種飄忽不定的體驗,讓我越來越想知道一件事:這玩意兒背后到底是哪個模型?


花了這么多錢,按理說心里應該踏實了。但偏偏相反,我反而更虛了。因為效果完全不確定,有時候感覺還行,有時候明顯不對勁。


有種,你都不知道自己是不是交了智商稅的錯覺。


這就很讓人難受了。你說它假吧,有時候確實挺聰明;你說它真吧,關鍵時刻掉鏈子。這種反復橫跳的體驗,比直接用個明知是假的模型更折磨人。


因為你沒有辦法做一個確定的判斷。


所以我決定自己動手,把這事搞清楚。從今年1月開始,我花了幾個月時間,研究怎么系統(tǒng)地驗證一個API背后模型的能力,將所有流程封裝成了一個Skill。


先說結論:


信中轉站,你真的還不如路邊拜個野佛。


你怎么知道中轉站的Claude是真是假?


這個時候,很多人包括我自己都在想一個問題:中轉站的模型,到底是不是正經的Claude?


你心里不踏實,就會想找辦法驗證。目前市面和各種社區(qū)里的方法,基本就這幾種。


第一種:直接問。


你上去就問API:「你是不是Claude?」


說實話,通過API接口寫一個完整的系統(tǒng)提示詞,這種方式根本識別不出來。太好造假了。背后給你接一個DeepSeek,改個名字說自己是Claude Opus 4.8,API驗證層面一點辦法都沒有。


第二種:稀奇古怪的提示詞工程。


用各種稀奇古怪的提示詞去套模型,看輸出質量,或者看某些奇奇怪怪的輸出結果,比如下面這個:


這種方法在2024年可能還行,但都兩年過去了,中轉站連這套都不需要做多復雜的系統(tǒng)提示詞就能應對,基本已經徹底失效。這種方法屬于是中轉站看了都要笑的程度。


第三種:在線檢測網站。


有些網站號稱能檢測API中轉站是否摻水。我試過,發(fā)現(xiàn)整個檢測流程在15秒以內就跑完了。



這從原理上就不可能。


正常答一道題,模型本身就要花幾秒。更重要的是,中轉站的token輸出速度和API路徑的穩(wěn)定性本來就有問題。接入量一大,延遲和截斷都是家常便飯。15秒能測什么?測一道題的格式對不對還行,測模型的知識正確率和綜合能力,天方夜譚。


那到底怎么辦?


我的思路:不測真假,測差距


從今年1月開始,我就在研究怎么驗證一個模型的能力。


最開始想到的當然是Benchmark。但調研了一圈發(fā)現(xiàn),這個問題的答案比我想的復雜得多。


一方面,Claude官方曬出來的那些分數(shù),背后用的數(shù)據(jù)集確實是內部私有的。比如Claude Sonnet 4.6的System Card里明確提到,他們測Terminal-Bench 2.0時用的是Terminus-2 harness,思考模式關閉,資源分配做了特殊處理。SWE-bench Multimodal干脆直接說用了「internal implementation」,分數(shù)不跟公開榜單可比。你拿到手的只是一個最終數(shù)字,題庫本身根本不公開。



另一方面,大量公開Benchmark其實一直都存在。像SWE-bench Verified、GAOKAO-Bench、C-Eval、GSM8K、MMLU等等,這些數(shù)據(jù)集都是開源的,題庫穩(wěn)定,任何人都能測。CAICT 2024年的一份報告里統(tǒng)計過,當前主流評測數(shù)據(jù)集中,開源的大概占69%,閉源只占31%。


所以問題是:怎么用好這些現(xiàn)成的公開數(shù)據(jù)集來驗證中轉站?


調研到這里,我換了個思路。


不一定非要用最新的Benchmark??!既然這么難到手。


這里有一個我夜深人靜思考時突然想明白的、反直覺的點:每次Claude或者OpenAI推出新模型,前半個月到一個月,這個模型本身就是降智的。但無論怎么降智,它肯定還是比很多國產模型強。所以大家的默認認知是:新模型發(fā)布之后,默認它已經比上一代強很多,舊Benchmark根本沒有測試的必要了。


這個認知是大錯特錯的。


新模型確實比舊模型強,但強歸強,舊題庫它未必能全做對。而且Benchmark的數(shù)據(jù)集本身是公開的、相對穩(wěn)定的,用它來做對比驗證,反而是最靠譜的方式。


所以我的思路變成了:不追求給出「yes or no」的答案,而是找一個參照物做對比。


找一個基礎模型,用同一套題庫測出分數(shù),再測你的API分數(shù),兩個分數(shù)一對比,就知道這個API到底是摻了水、還是真貨。


Skill是怎么做出來的?


于是,說干就干,我做了一個完整的驗證中轉站API知識能力的Skill,并做出了一套打分機制。


具體來說,我找GitHub上10個高Star數(shù)的項目,每個項目里都有對應的Benchmark數(shù)據(jù)集和驗證腳本。




這些數(shù)據(jù)集來源非常多樣,有中文高考題、推理題、數(shù)學題、語言題、編程題,覆蓋面挺廣。


Skill的設計邏輯是這樣的:


第一步,做API兼容性??梢越覱penAI接口,也可以接Anthropic接口。


第二步,從這10個項目里構建一個完整的manifest,等于把數(shù)據(jù)集統(tǒng)一整合起來。


第三步,按順序用這些題去請求目標API。每答完一題就寫入JSONL文件。


第四步,用打分器判分。有些項目自帶打分器,直接用;有些需要自己寫。


第五步,所有題跑完之后,把結果聚合成一個加權MCS分數(shù)。


在實際使用中,我發(fā)現(xiàn)中轉站API非常不穩(wěn)定,經常會出現(xiàn)截斷。這個Skill設計了一個關鍵能力:用Claude Code或Codex跑的時候,AI本身會接入能力,當API答題被截斷時,可以讓AI幫忙重新做一遍這道題。這樣最終評分不會因為格式問題出現(xiàn)大面積零分。


做完之后,這個Skill共有726道題,從10個項目里挑出來的精華部分。每個題目都有一個索引。




每題會得到一個item_score,通常是0或1,少數(shù)instruction-following題目可以是0.5。



MCS計算方式是這樣的:


MCS=各能力維度分數(shù)×權重后的加權平均


測完數(shù)據(jù),結果讓我心態(tài)崩了


先說基準模型。DeepSeek V4 Pro這個模型本身效果不錯,大家關注度也高。而且DeepSeek官方API比較穩(wěn)定,用起來放心。


最終得分:66.76分,滿分100。在推理、數(shù)學、中文、編程幾個維度上表現(xiàn)都還行。



然后就是重頭戲了。我一直用的那幾家平臺,Claude Opus 4.8的API。這幾家平臺是某檢測中轉站的網站里推薦的,我用了挺長時間,用的時候心里一直犯嘀咕。有時候感覺挺聰明,有時候又覺得不太行。


跑完整個題庫之后,心態(tài)直接崩了。


您猜猜花了這么多錢買的模型,最后得分多少?


59.73分。


不如DeepSeek V4 Pro(當然這里不是在說DeepSeek V4 Pro的模型不行)


這家平臺在一些結構性數(shù)據(jù)題目上可能確實不太占優(yōu)勢,但DeepSeek V4 Pro同樣不占優(yōu)勢。去掉Data Structure這一項,它的數(shù)學推理、Coding能力,得分也都低得離譜。



到這一步我人已經麻了。光是一次日常行政任務潤色,一次就要花近30塊錢,結果買了個這。


我不死心,又測了另一家。


這家倍率是2.0倍率。在懂行的人眼里,2.0倍率算是正經Claude的基準線。低于1.5倍率大家會覺得太便宜不像真的,2.0倍率大家普遍覺得應該是真貨。


我再跑了一遍。


51.55分。


推理、數(shù)學、編程分數(shù)跌得更慘。



到這里,我人整個已經麻了,麻的透透的。


最離譜的是成本。DeepSeek V4 Pro跑完整套題,用了不到100萬token,**花了9塊9毛7。



兩家自稱正經Claude Opus 4.8的中轉站,一個花了35塊以上,一個花了近20塊。



這還是726道舊題,跑起來DeepSeek V4 Pro大概不到一小時就跑完了,但中轉站API不穩(wěn)定,跑了將近兩小時。


你就知道那些號稱十幾秒就能測出模型知識能力的在線檢測,有多不靠譜了。


再簡單說下,如何跑這個Skill,我們需要用Codex或者Claude Code,因為它本身依賴AI能力來處理截斷和異常。如果50道題全是零分,問題大概率不在API,而是打分器或格式出了固定bug,需要人工介入修復。


疊甲時間


這個Skill還是非常初級的版本,用的數(shù)據(jù)集也比較舊。它只能作為一個小參考,不能拿來判定某個API到底是不是正經Claude。因為官方Benchmark你基本拿不到,所以也沒辦法給出更精準的答案。


當然了,如果有人能非常便捷地測出一個API是不是正經Claude,那中轉站這個生意就沒法做了,對吧?


但問題是,這個行業(yè)連"初級"的驗證標準都沒有。消費者花著真金白銀,連自己買的到底是不是Claude都不知道。


這事兒本身就不對。這事兒本身就不對。這事兒本身就不對。(重要事情說三遍)


如果只靠這個Skill,你依然需要花費1h以上的時間去驗證,甚至要花30-50塊錢,這個門檻對驗證中轉站API來說依舊不現(xiàn)實。


如果大家還有什么其他好的驗證中轉站API的想法,歡迎在評論區(qū)留言!


最后希望大家玩得開心。

AI創(chuàng)投日報頻道: 前沿科技
本內容由作者授權發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
临沭县| 阜宁县| 兴义市| 长沙市| 平阳县| 宜宾县| 正阳县| 沙河市| 木里| 承德县| 静宁县| 广州市| 芦溪县| 苗栗县| 朝阳县| 夹江县| 凤台县| 无棣县| 大余县| 新余市| 南乐县| 易门县| 获嘉县| 辽阳县| 女性| 花莲市| 湘西| 南昌县| 龙里县| 青岛市| 玉田县| 龙口市| 泸西县| 昌宁县| 平安县| 固阳县| 安远县| 闽清县| 营山县| 延吉市| 蕉岭县|