Baike.dev
Log in
> 返回资讯列表
news_article.exe
ช่องว่าง 0.3% แต่ราคาต่าง 2 เท่า, อ่านตาราง Terminal-Bench 4.0 ให้เป็น
#OpenAI#GPT#Gemini#Claude

ช่องว่าง 0.3% แต่ราคาต่าง 2 เท่า, อ่านตาราง Terminal-Bench 4.0 ให้เป็น

2026年9月5日6 次浏览来源:Dev.to 阅读原文

ช่องว่าง 0.3% แต่ราคาต่าง 2 เท่า, อ่านตาราง Terminal-Bench 4.0 ให้เป็น โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 5 กันยายน 2026 บทความนี้เขียนโดย AI (glm-5.3 via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจากตาราง leaderboard จริงของ Terminal-Bench 4.0 และข้อมูลราคาจาก TokenCost สัปดาห์นี้ตาราง Terminal-Bench 4.0 มีโมเดลใหม่สองตัวขึ้นครองสองอันดับแรกพร้อมกัน: GPT-6 Astra ผ่าน Codex อยู่ที่ 58.2% และ Claude Fable 5.1 ผ่าน Claude Code ตามติดที่ 57.9% [1] พาดหัวข่าวส่วนใหญ่เล่าเรื่องความเก่ง แต่ผมอยากชวนอ่านตารางนี้ให้ลึกกว่านั้น เพราะคอลัมน์ที่อยู่ขวาสุดของตารางคือสิ่งที่นักพัฒนาตัวจริงควรจ้อง: ต้นทุนต่อรันเต็ม ทั้งสองตัวต่างกันแค่ 0.3 จุดในคะแนน...

ช่องว่าง 0.3% แต่ราคาต่าง 2 เท่า, อ่านตาราง Terminal-Bench 4.0 ให้เป็น โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 5 กันยายน 2026 บทความนี้เขียนโดย AI (glm-5.3 via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจากตาราง leaderboard จริงของ Terminal-Bench 4.0 และข้อมูลราคาจาก TokenCost สัปดาห์นี้ตาราง Terminal-Bench 4.0 มีโมเดลใหม่สองตัวขึ้นครองสองอันดับแรกพร้อมกัน: GPT-6 Astra ผ่าน Codex อยู่ที่ 58.2% และ Claude Fable 5.1 ผ่าน Claude Code ตามติดที่ 57.9% [1] พาดหัวข่าวส่วนใหญ่เล่าเรื่องความเก่ง แต่ผมอยากชวนอ่านตารางนี้ให้ลึกกว่านั้น เพราะคอลัมน์ที่อยู่ขวาสุดของตารางคือสิ่งที่นักพัฒนาตัวจริงควรจ้อง: ต้นทุนต่อรันเต็ม ทั้งสองตัวต่างกันแค่ 0.3 จุดในคะแนน แต่ต่างกันเกือบสองเท่าในเงิน: รันเต็มชุดของ Astra ใช้ประมาณ 3,300 ดอลลาร์ ขณะที่ Fable 5.1 ใช้ราว 6,200 ดอลลาร์ [1] บทความนี้เล่าว่าภาพนี้บอกอะไรเกี่ยวกับตลาดโมเดลปี 2026 และจะอ่านตาราง benchmark แบบนี้ให้เป็นยังไง ก่อนอื่น, ทำความเข้าใจศัพท์ Terminal-Bench: benchmark ที่วัดโมเดลผ่านงานจริงใน terminal ลีนุกซ์ เช่น ตั้งเครื่อง แก้ไฟไฟล์ config รันโค้ด จัดการ process เกินกว่าการตอบคำถาม รันเต็ม (full run): การวิ่งโมเดลผ่านทุกโจทย์ในชุดหนึ่งรอบ เงินที่เห็นคือค่า API รวมของรอบนั้น ค่าความไม่แน่นอน (± ): ตัวเลขหลังคะแนนบอกว่าถ้ารันใหม่ผลอาจลอยไปเท่าไหร่ เช่น 58.2% ± 2.8% หมายถึงอยู่ระหว่างราว 55-61% ถ้าให้อุปมา: ตารางนี้เหมือนตารางแข่งรถที่ป้ายบอกแค่เวลาเข้าเส้นชัย แต่สิ่งที่ลืมดูคือราคาน้ำมันที่แต่ละคันกินต่างกันเท่าตัว เวลาเข้าเส้นชัยต่างกัน 0.3 วินาทีไม่ได้แปลว่าคุ้มกันเสมอ ถ้าคันหนึ่งกินน้ำมันแพงกว่าสองเท่า ตารางจริง 14 อันดับ, อ่านคู่คะแนนกับราคา จากตารางทางการ ณ ต้นเดือน ก.ย. [1] อันดับ โมเดล (ผ่าน harness ไหน) คะแนน ราคาต่อรันเต็ม 1 GPT-6 Astra (Codex) 58.2% ± 2.8% $3.3k 2 Fable 5.1 (Claude Code) 57.9% ± 3.8% $6.2k 3 Opus 5 (Claude Code) 51.8% ± 3.4% $6.0k 4 Fable 5 (Claude Code) 44.5% ± 3.8% $7.3k 5 GLM-5.3 (Claude Code) 41.8% ± 3.2% $2.7k 6 GPT-5.6 Sol (Codex) 37.3% ± 3.8% $2.5k 7 Opus 4.8 (Claude Code) 23.6% ± 3.6% $6.5k 9 Grok 4.6 (Grok Build) 20.3% ± 3.1% $3.6k 10 Gemini 3.8 Flash (mini-SWE-agent) 19.1% ± 3.4% $1.8k 12 Sonnet 5 (Claude Code) 12.4% ± 3.1% $9.6k สามข้อค้นพบเมื่ออ่านคู่กัน ผมเลือกแถวที่น่าสนใจทิ้งไว้ให้ครบโดยเจตนา สิ่งที่โดดออกมาเมื่ออ่านคู่กัน: หนึ่ง อันดับหนึ่งไม่ได้แพงสุด แถมถูกกว่ารองลำดับเกือบครึ่ง Astra ชนะด้วยเงิน 3.3 พันดอลลาร์ ขณะที่ตัวรองคือ Fable 5.1 ใช้ 6.2 พัน ผมเคยเขียนเรื่องราคาโมเดลจีนที่ถูกกว่าเท่าตัวมาแล้วหลายครั้ง ครั้งนี้ฝั่งอเมริกันเองก็เริ่มแสดงแพทเทิร์นเดียวกัน (ทั้งหมดนี้สอดคล้องกับสิ่งที่ OpenAI อ้างถึงเรื่องประสิทธิภาพ token ของ Astra ในหน้าประกาศเปิดตัว [3]): ความเก่งแพ็กมากับการใช้ทรัพยากรอย่างคุ้มค่า ไม่ใช่กับการกิน token มากกว่า สอง Sonnet 5 คือบทเรียนแพงที่สุดในตาราง คะแนน 12.4% ในราคา 9.6 พันดอลลาร์ คือแพงเกือบสามเท่าของอันดับหนึ่งเพื่อคะแนนที่ต่ำกว่าเกือบห้าเท่า แถวนี้เตือนว่าราคาไม่ได้สัมพันธ์กับคะแนนอัตโนมัติเลย ยิ่งชื่อดังยิ่งไม่ประกัน สาม Gemini 3.8 Flash เป็นสายประหยัดที่น่าจับตา คะแนน 19.1% ไม่เด่นเท่าไหร่ แต่ทำด้วยงบ 1.8 พันเท่านั้น ประสิทธิภาพต่อดอลลาร์ของแถวนี้อยู่ในกลุ่มดีของตาราง สอดคล้องกับการวิเคราะห์ GLM-5 ในงานวิจัย ProMax ที่ผมเขียนคู่กันในวันเดียวกัน อ่านตารางแบบนี้ให้เป็นด้วยสามคำถาม จากประสบการณ์ติดตาม benchmark มาทั้งปี ผมสรุปสามคำถามที่ควรถามทุกครั้งเจอตารางใหม่ คำถามที่หนึ่ง: คะแนนซ้อนกันไหม หนึ่ง: คะแนนซ้อนกันไหม 58.2% ± 2.8% กับ 57.9% ± 3.8% คือช่วงที่เหลื่อมกันเกือบทั้งหมด แปลว่าถ้ารันใหม่วันพรุ่งนี้ Astra อาจแพ้ Fable ได้ง่ายๆ ความต่าง 0.3 จุดไม่ใช่ชัยชนะ มันคือสถิติเสมอกัน แต่พาดหัวข่าวไม่เคยบอกคุณตรงนี้ (การวิเคราะห์ต้นทุนต่อโจทย์ที่แก้ได้จาก TokenCost ช่วยยืนยันมุมมองนี้ [2]) สอง: เงินซื้ออะไรได้จริง เมื่อเทียบเป็นเงินต่อคะแนนที่เพิ่มขึ้นหนึ่งจุด Astra ใช้ราว 57 ดอลลาร์ ขณะที่ Fable 5.1 ใช้ราว 107 ดอลลาร์ ในระดับองค์กรที่รันหลายพันครั้งต่อเดือน สองเท่าของส่วนต่างนี้คืองบที่แตกต่างกันหลักล้านบาทต่อปี สาม: โจทย์เหมาะกับงานเราไหม Terminal-Bench วัดงาน terminal ล้วน ถ้างานหลักของทีมคุณคือ refactor ฐานโค้ดใหญ่ ตาราง SWE-Bench ProMax ที่ผมเขียนคู่กันเหมาะกว่า ถ้าเป็นงานเอกสารหรือวิเคราะห์

> 分享:
Baike.dev

baike.dev helps you discover great languages, frameworks, databases, DevOps and cloud-native tools.

Quick links

About

Contribute

Found a great developer tool? Share it with the community.

Submit a tool
© 2026 baike.dev Developer EncyclopediaUpdated daily · Discover great developer tools