ถูกกว่า 8 เท่า ได้คะแนนน้อยกว่า 2 จุด, เศรษฐศาสตร์เปลี่ยนวิธีเลือกโมเดล โดย Nokka (นก-กา) | 12 กันยายน 2026 บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka สมมติว่ามีคนบอกคุณว่าเลือกโมเดล AI ได้สองแบบ แบบแรกถูกกว่าแปดเท่า แต่ได้คะแนนความสามารถน้อยกว่าแค่สองจุด คำตอบที่คนส่วนใหญ่ตอบทันทีคือเอาแบบถูก แต่ตอนจ่ายเงินจริง คนกลับเลือกอีกแบบ ช่องว่างตรงนี้คือเรื่องที่บทความนี้อยากชี้ให้เห็น เพราะตัวเลขบนกระดาษกับต้นทุนที่จ่ายจริงเป็นคนละเรื่องกัน ตัวเลขที่ดูขัดกับสามัญสำนึก Artificial Analysis วัดโมเดลด้วยดัชนีชุดเดียว แล้วรายงานทั้งคะแนนและต้นทุนต่อหนึ่งงานที่ทดสอบ [1][2] ผลที่ออกมาคือ GLM-5.3-Flash ได้คะแนน 42 ด้วยต้นทุน 0.25 ดอลลาร์ต่องาน ส่วน Kimi K3 ได้คะแนน 44 ด้วยต้นทุน 2.00 ดอลลาร์ต่องาน ห่างกันสองคะแนน แต่ต้นทุนต่องานต่างกันแปดเท่า ถ้ามองจากมุมของคนทำงาน ตัวเลขนี้ควรจบการตัดสินใจ แต่ในทางปฏิบัติไม่ได้เป็นแบบนั้น และเหตุผลก็สมเหตุสมผลกว่าที่คิด ทำไมคนถึงยังเลือกรุ่นแพง เหตุผลแรกคือความเสียหายจากความผิดพลาดไม่ได้คิดเป็นโทเคน ถ้างานหนึ่งชิ้นล้มเหลวแล้วต้องทำใหม่ ต้นทุนไม่ได้มีเพียงค่า API แต่รวมถึงเวลาของคนที่ต้องมานั่งตรวจและแก้ ถ้างานนั้นสำคัญพอ โมเดลที่แพงกว่าสามเท่าแต่ล้มเหลวน้อยกว่าก็คุ้มกว่าอยู่ดี เหตุผลที่สองคือหน่วยที่วัดไม่ตรงกับที่งานต้องการ คะแนนรวมวัดจากชุดทดสอบผสม แต่ถ้างานของคุณคืออ่านเอกสารกฎหมายยาว ๆ ตัวเลขที่ควรดูไม่ใช่คะแนนรวม แต่เป็นคะแนนเฉพาะด้านนั้น [1] ยกตัวอย่างจากข้อมูลเดียวกัน Kimi K3 ได้ Humanity's Last Exam 47 และ CritPt 23 ซึ่งสูงกว่าคู่แข่งอย่างชัดเจน ในขณะที่ GLM-5.3-Flash ได้ 40 และ 15 [2] แต่ถ้าดูงานที่ต้องลงมือทำ GLM-5.3-Flash กลับได้ Terminal-Bench 33 เปอร์เซ็นต์ ขณะที่ Kimi K3 ได้แค่ 13 [2] คนละงาน คนละคำตอบ และคะแนนรวมบอกไม่ได้ เหตุผลที่สามคือราคาที่ประกาศกับราคาที่จ่ายจริงไม่เท่ากัน ราคาบนกระดาษหลอกตาได้หลายทาง ทางแรกคือส่วนลดช่วงเวลา ราคาต่อโทเคนของ GLM-5.3-Flash บนเว็บ OpenRouter แสดงที่ 0.075 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 0.25 ขาออก แต่ตัวเลขนี้เป็นราคาโปรโมชัน ไม่ใช่ราคาปกติที่ 0.15 และ 0.50 [3] ถ้าวางแผนงบจากราคาโปรแล้วโปรหมด งบจะขาดทันที ทางที่สองคือราคาแคช ซึ่งต่างจากราคาปกติหลายเท่าตัว ของ DeepSeek V4.1 Flash ราคาโทเคนเข้าแบบโดนแคชอยู่ที่ 0.006 ดอลลาร์ต่อล้าน เทียบกับ 0.30 ดอลลาร์เมื่อไม่โดนแคช [4] ห่างกันห้าสิบเท่า ความหมายในทางปฏิบัติคืองานที่ส่งบริบทเดิมซ้ำ ๆ เช่นระบบที่ต้องแนบเอกสารชุดเดิมทุกคำขอ จะถูกลงกว่าราคาบนกระดาษมาก และงานที่ส่งบริบทใหม่ทุกครั้งจะแพงกว่านั้นมาก ทางที่สามคือโหมดคิดเหตุผลที่ปิดไม่ได้ Kimi K3 และ GLM-5.3 เปิดโหมดคิดไว้ตลอด ปรับได้แค่ระดับต่ำ กลาง สูงสุด [5][6] ทุกคำขอจึงสร้างโทเคนของการคิดเพิ่มเสมอ ซึ่งเป็นโทเคนที่จ่ายจริง ตัวเลขที่วัดได้คือ Kimi K3 ใช้โทเคนขาออก 48,000 โทเคนต่องาน และในจำนวนนั้นเป็นโทเคนคิด 32,000 โทเคน [2] สองในสามของค่าใช้จ่ายมาจากการคิดที่ผู้ใช้ไม่ได้เห็น ต้นทุนที่ตัวเลข API ไม่บอก อีกเรื่องที่คนมักลืมคิดคือความเร็วมีค่าเป็นเงิน Kimi K3 ทำงานหนึ่งงานใช้เวลาเฉลี่ย 1,093 วินาที หรือประมาณ 18 นาที ส่วน GLM-5.3-Flash ใช้ 572 วินาที ประมาณ 9 นาทีครึ่ง [2] ถ้าคุณมีงาน 100 ชิ้นที่ต้องทำแบบขนานกัน ความต่างของเวลานี้ไม่ได้มีเพียงเรื่องรอ แต่มันตัดสินว่าต้องเช่าเครื่องเพิ่มหรือไม่ และค่าเครื่องคือค่าใช้จ่ายที่ไม่มีในใบเสร็จของ API ตัวเลขความเร็วที่วัดได้ชัดกว่าคือ Kimi K3 สร้างข้อความได้ 38 โทเคนต่อวินาที ขณะที่ GLM-5.3-Flash ทำได้ 95 โทเคนต่อวินาที [2] ต่างกันสองเท่าครึ่ง อีกต้นทุนที่ซ่อนอยู่คือค่าใช้จ่ายในการลองผิด ลองถูก โมเดลที่ตอบช้าทำให้รอบทดลองนานขึ้น ซึ่งเป็นเวลาของคนที่หมดไปจริง แล้วควรเลือกอย่างไร คำตอบที่ใช้ได้จริงไม่ใช่การเลือกรุ่นเดียว แต่เป็นการแยกงานตามความทนต่อความผิดพลาด งานที่มีความทนต่อความผิดพลาดสูง งานที่ทำซ้ำได้ ผิดแล้วลองใหม่ได้ ไม่มีคนรอผลลัพธ์ ใช้รุ่นถูกได้เต็มที่ งานจำพวกนี้คือที่ที่ตัวเลข 0.25 ดอลลาร์ต่องานมีความหมายจริง งานที่ใช้บริบทเดิมซ้ำบ่อย งานที่แนบเอกสารชุดเดิม ระบบที่ทำงานกับชุดข้อมูลคงที่ ตรวจก่อนว่าราคาแคชของค่ายนั้นเท่าไร แล้วคำนวณใหม่จากตัวเลขนั้น ไม่ใช่จากราคาปกติ งานที่ล้มเหลวแล้วแพง งานที่ต้องส่งลูกค้า งานที่ตรวจแล้วต้องแก้เองทั้งหมด เลือกจากคะแนนเฉพาะด้านของงานนั้น ไม่ใช่คะแนนรวม และถ้าต่างกันแค่สองคะแนน การจ่ายแพงกว่าแปดเท่ามีเหตุผลรองรับได้ งานที่ต้องใช้ความรู้รอบตัว อันนี้ต้องระวังเป็นพิเศษ เพราะรุ่น Flash มีจุดอ่อนด้านนี้ชัดเจน GLM-5.3-Flash ได้คะแนนความรอบรู้ 7 ขณะที่ Kimi K3 ได้ 20 [2] ส่วน DeepSeek V4.1 Flash ได้คะแนนความรอบรู้ต่ำเช่นกัน [1] ข้อควรระวัง หนึ่ง ตัวเลขต้นทุนต่องานของ Artificial Analysis คำนวณจากอัตราส่วนแคชที่กำหนดไว้ ไม่ใช่จากรูปแบบการใช้งานของคุณ ตัวเลขจริงของคุณจะต่างออกไป ควรวัดจากงานของตัวเอง [1] สอง ราคาโปรโมชันมีกำหนดเวลา ต้องตรวจวันหมดอายุทุกครั้งก่อนวางงบ [3] สาม คะแนนจากค่ายผู้ผลิตเองกับจากหน่วยวัดอิสระไม่เท่ากัน เพราะชุดทดสอบต่างกัน เมื่อเทียบข้ามค่ายให้อยู่ในชุดเดียวกัน [4][6] สี่ คะแนนเดียวกันจากดัชนีคนละเวอร์ชันต่างกันได้ถึง 15 จุด ไม่ใช่เรื่องเล็ก ยกตัวอย่างที่จับต้องได้ GLM-5.3-Flash ได้ 57 คะแนนบนดัชนีเวอร์ชัน 4.1.1 ซึ่งเป็นตัวเลขที่ Z.ai อ้างถึงในหน้าประกาศของตัวเอง [6] แต่บนดัชนีเวอร์ชัน 4.3 ที่เปิดตัววันที่ 7 กันยายน 2026 คะแนนเดียวกันเหลือ 42 [7] GLM-5.3 ก็เช่นกัน จาก 60 เหลือ 45 [7] สาเหตุไม่ได้มาจากตัวโมเดลเปลี่ยน แต่มาจากดัชนีเปลี่ยนไปใช้ชุดทดสอบที่ยากขึ้น ตัวเลขที่ต่างกัน 15 จุดนี้จึงไม่ได้แปลว่าความสามารถลดลง ตัวเลขในบทความนี้เป็นของดัชนีเวอร์ชัน 4.3 ทั้งชุด ถ้าไปเจอตัวเลขที่ต่างจากนี้ในที่อื่น ให้เช็คก่อนว่าเขาอ้างเวอร์ชันไหน ไม่งั้นจะเทียบกันคนละฐาน มุมมองจากคนที่จ่ายค่าโมเดลเองทุกเดือน ผมจ่ายค่าโมเดลจากกระเป๋าตัวเอง ทุกบาททุกสตางค์ และบทเรียนที่ชัดที่สุดคือราคาต่อโทเคนเป็นตัวเลขที่ใช้ตัดสินใจได้แย่ที่สุดในบรรดาตัวเลขทั้งหมด ผมเคยเลือกจากราคาถูก แล้วพบว่าต้องส่งคำขอซ้ำเพราะคำตอบใช้ไม่ได้ รวมกันแล้วแพงกว่าเดิม อีกครั้งหนึ่งผมเลือกจากคะแนนสูงสุด แล้วพบว่าราคาแคชของงานที่ผมทำอยู่ทำให้มันถูกกว่าที่คิดไว้มาก เพราะงานผมใช้บริบทเดิมซ้ำ สิ่งที่ผมทำตอนนี้คือวัดสองอย่างก่อนตัดสินใจ อย่างแรกคือต้นทุนจริงของงานที่ทำบ่อยที่สุด ไม่ใช่ราคาต่อล้านโทเคน อย่างที่สองคืออัตราความล้มเหลวของงานนั้น เพราะงานที่ต้องทำซ้ำคือต้นทุนที่มองไม่เห็น คำแนะนำของผมคือเริ่มจากงานที่ล้มเหลวแล้วไม่เสียหายอะไร ใช้รุ่นถูกวัดอัตราความสำเร็จกับงานของคุณเอง ถ้าตัวเลขพอใช้ก็จบ ไม่ต้องจ่ายเพิ่ม แต่ถ้าล้มเหลวบ่อยจนต้องทำซ้ำเกินครึ่ง การขยับขึ้นรุ่นแพงกว่าจะถูกกว่าที่คิด เพราะต้นทุนจริงไม่ได้อยู่ในใบเสร็จ มันอยู่ในเวลาที่คุณเสียไป แหล่งอ้างอิง [1] Artificial Analysis, "DeepSeek V4.1 Flash (Reasoning, Max Effort) vs GLM-5.3-Flash" (2026), https://artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash [2] Artificial Analysis, "GLM-5.3-Flash vs Kimi K3 (max)" (2026), https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-glm-5-3-flash [3] OpenRouter, "Z.ai: GLM 5.3 Flash" (2026), https://openrouter.ai/z-ai/glm-5.3-flash [4] DeepSeek, "DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient" (10 ก.ย. 2026), https://api-docs.deepseek.com/news/news260910/ [5] Moonshot AI, "Kimi K3 Tech Blog: Open Frontier Intelligence" (16 ก.ค. 2026), https://www.kimi.ai/blog/kimi-k3 [6] Z.ai, "GLM-5.3-Flash: Frontier Intelligence, Flash Cost" (2026), https://z.ai/blog/glm-5.3-flash [7] Artificial Analysis, "Announcing the Artificial Analysis Intelligence Index v4.3" (7 ก.ย. 2026), https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3