การวิจัยและพัฒนาเอเจนต์ AI: การเปรียบเทียบจริงระหว่าง Gemini กับ DeepSeek, เหตุผลที่ไม่เปลี่ยนไปใช้ในระบบจริงเพราะราคาถูกเพียงอย่างเดียว
ปัญญาประดิษฐ์ทางการเงิน/ผู้แทน AI วิจัยและพัฒนา
AIエージェント研究開発:GeminiとDeepSeekを実測比較、安さだけで本番切替しなかった理由
สิ่งที่ควรพิจารณาเมื่อเลือกโมเดลผู้แทน AI ไม่ใช่แค่ค่าใช้จ่ายต่อหน่วยความแม่นยำในการตอบ การเรียกใช้งูมเครื่องมือ กระบวนการคิดเงิน การหยุดชะงักเพื่อความปลอดภัย และหลักฐานที่สามารถกลับไปสู่การใช้งานจริงได้ จึงได้ทำการทดสอบใหม่โดยนำ Gemini และ DeepSeek มาเปรียบเทียบภายใต้เงื่อนไขเดียวกัน
※บทความนี้เป็นบันทึกการพัฒนาและการทดลองของผู้แทน AI หลายตัวรวมถึงอินเทอร์เฟซที่พัฒนาขึ้นเองและซอฟต์แวร์ซื้อขายอัตโนมัติ (EA) ในสภาพแวดล้อมที่ใกล้เคียงกับการใช้งานจริง พร้อมทั้งสะสมข้อมูลประเมินความสำเร็จและความล้มเหลวเพื่อปรับปรุงตรรกะทางการเงิน AI โดย GOLD13 ได้รับการตรวจสอบในบัญชีจริงในช่วงเวลาทำการ 24 ชั่วโมง ซึ่งเปิดเผยผ่านการถ่ายทอดสดด้วย
เปรียบเทียบทั้งสองระบบใน 60 รูปแบบเดียวกัน
การเปรียบเทียบทำใน 60 รูปแบบของ Gemini และ DeepSeek สาเหตุการสิ้นสุดคือ Gemini stop 45 และ tool_calls 15, DeepSeek stop 43 และ tool_calls 17 โดยความยาวข้อความถึงแม้สิ้นสุดที่ 0 ทั้งคู่และไม่มี API error
ไม่ใช่เฉพาะบทสนทนาธรรมดาเท่านั้น ยังรวมถึงทางเดินที่ต้องใช้เครื่องมือ การเดินทางที่ไม่ควรเรียกใช้เครื่องมือ การถ่ายทอดต่อด้วยความปลอดภัยสำหรับผู้เยาว์และการบำรุงดูแลสำหรับการสื่อสารหลายภาษา รวมถึงความต้องการตรวจสอบที่การตัดสินใจและการบันทึก การคิดเงิน และเงื่อนไขการหยุดด้วย
การตรวจสอบต้นทุนต่อการส่งคำถีบใน 1 รอบ
- Gemini ราคาส่งเสริมในปี 2026: เฉลี่ยประมาณ 0.689 เยนต่อรอบ
- Gemini ราคาหลักในปี 2027 แปลงเป็นจริง: เฉลี่ยประมาณ 1.378 เยนต่อรอบ
- พีค DeepSeek: เฉลี่ยประมาณ 0.501 เยนต่อรอบ
- พีค DeepSeek นอกช่วง: เฉลี่ยประมาณ 0.251 เยนต่อรอบ
ใน DeepSeek มีการCache-hit ของ 307,065 จากอินพุต 318,893 โทเคน อัตราการฮิตจริงอยู่ที่ 96.3% ค่าต้นทุนด้านบนของ DeepSeek คำนวณจากอินพุตทั้งหมดด้วยราคาต่ำสุดซึ่งเป็นตัวประมาณการที่ระมัดระวัง ดังนั้นค่าเรียกเก็บจริงน่าจะต่ำลง
ราคาถูก แต่คุณภาพยังมีความต่างอยู่
ด้านต้นทุน DeepSeek ดูได้เปรียบ แต่ยังไม่สามารถยืนยันว่าทุกเส้นทางมีคุณภาพเท่ากันได้ในสถานการณ์ทั้งหมด สำหรับคำถามเชิงเทคนิคที่เป็นผู้จัดการต้องมีการตรวจสอบด้วยสายตาใน 2 กรณี และการถ่ายทอดจากคำถามทางเทคนิคไปยังโค้ชที่รับผิดชอบใน 4 ใน 5 ภาษา ยกเว้น zh-TW ที่ไม่ได้ตรวจพบ
การบันทึกข้อมูลยังประกอบด้วยการบันทึกในตําแหน่งที่ 3/5 การบันทึกการโยนบอล 4/5 การบันทึกผลการแข่งขัน 5/5 และการแก้ไขผล 5/5 ส่วนที่ยังไม่ยิงคือกรณีที่โมเดลไม่สามารถระบุการแข่งขันได้แน่ชัดและตอบกลับคำถามเพื่อยืนยัน ซึ่งอาจมองว่าเป็นการทำงานเพื่อความปลอดภัยเพื่อป้องกันการบันทึกผิด แต่ในแง่มุม “ต้องบันทึกในการรอบเดียว” ยังไม่บรรลุ
การทดสอบฐานข้อมูลจริงในสภาพแวดล้อมแยกส่วน ผ่าน 21 รายการผ่าน
ไม่แตะต้องพอร์ตจริง 4002 และเปิดอินสแตนซ์สำหรับการทดสอบที่ 4102 เพื่อยืนยัน 9 เทิร์นระหว่าง HTTP จริงและฐานข้อมูลจริง บันทึก แก้ไข การเรียกเก็บเงิน การบันทึกในกรณีเงินคงเหลือหมด การป้องกันการเรียกซ้ำในเป้าหมายเดียว 21 รายการผ่านทั้งหมด หลังเสร็จสิ้นกระบวนการทดสอบจะหยุดกระบวนการตรวจสอบและยืนยันว่า port 4002 ในสภาพจริงยังตอบ 200 ได้
การเปลี่ยนไปใช้งานจริงยังไม่ดำเนินการ
ถึงแม้จะมีผลลัพธ์เช่นนี้ แต่ยังไม่ทำการเปลี่ยนไปใช้งานจริงกับ DeepSeekการตั้งค่าบนผู้ให้บริการจริงยังเป็นค่าว่าง และหลังได้รับอนุมัติจะเปลี่ยนเพียงสายจำเพาะบางส่วน พร้อมการเฝ้าระวัง 24 ชั่วโมง ทุนต่ำกว่าก็สามารถทำได้โดยแยกส่วนในการพิจารณา
การตรวจสอบวิดีโอ:บทความนี้เป็นบันทึกการเปรียบเทียบโมเดลและการตรวจสอบฐานข้อมูลจริง ไม่ใช่บทความเกี่ยวกับการเทรด GOLD13 โดยตรงจะไม่ฝังการบันทึกการเทรดที่ไม่เกี่ยวข้อง
บทความนี้เป็นบันทึกการวิจัยและการตรวจสอบ ไม่รับประกันกำไรหรือประสิทธิภาพในอนาคต
ถ้าเงื่อนไขการเปรียบเทียบไม่เท่าเทียม ค่าใช้จ่ายจะไม่มีความหมาย
ในการเปรียบเทียบโมเดล ปัจจัยเรื่องความยาวของ prompt ประวัติการสนทนา การใช้งานเครื่องมือ ภาษา เงื่อนไขการแคช ล้วนมีผลต่อค่าใช้จ่ายและอัตราความสำเร็จ เราเปรียบเทียบ 60 รูปแบบเดิมในแบบเดียวกัน โดยบันทึก stop, tool_calls, length และ API error ด้วยวิธีเดียวกัน
หากใส่การสนทนาที่ง่ายๆ มากเกินไป เครื่องมือที่จำเป็นสำหรับงานจริงอาจถูกมองข้าม จึงรวมกรณีที่ควรบันทึก กรณีที่ไม่ควรบันทึก และข้อความที่ต้องสอบถามเพื่อยืนยัน ความไม่ชัดเจน ในกรณีของผู้เยาว์หรือกรณีที่ต้องปรึกษาปัญหาบาดเจ็บ และการสื่อสารหลายภาษา รวมถึงการคิดเงินด้วย
การประเมินว่าเครื่องมือไม่ได้ถูกใช้งานอย่างไร
ตัวเลข 3/5 และ 4/5 อย่างเดียวอาจดูเหมือนล้มเหลว แต่บางกรณีมาจากโมเดลไม่สามารถระบุการแข่งขันได้แน่ชัด และต้องตอบคำถามเพื่อยืนยัน ปลอดภัยกว่าการบันทึกการแข่งขันที่ผิดพลาด แต่ไม่ใช่ข้อกำหนด “เสร็จสิ้นในรอบเดียว”
ดังนั้นเราจะประเมินไม่เฉพาะว่าเครื่องมือถูกเรียกใช้งานหรือไม่ แต่รวมถึงเหตุผลที่ไม่ถูกเรียกใช้งาน ความเหมาะสมของคำถามยืนยัน และความเป็นไปได้ที่คำตอบถัดไปจะทำให้เสร็จสิ้น การเงิน AI ก็เช่นเดียวกัน ควรบันทึกข้อเท็จจริงว่าไม่สั่งซื้อและเหตุผลที่ชัดเจนในการพิจารณายกเลิกด้วย
สิ่งที่ 96.3% ของแคชบอกเรา
มีการแฮตแคช 307,065 โทเคน จาก 318,893 โทเคนที่อินพุตของ DeepSeek สำหรับงานทั่วไปที่มีคำสั่งและบริบททั่วไป จะเป็นความแตกต่างด้านต้นทุนอย่างมาก ในขณะเดียวกันในสถานการณ์ที่อินพุตเปลี่ยนแปลงตลอดเวลาเช่นสภาวะตลาด ไม่มีการรับประกันว่าอัตราฮิตจะคงที่
ด้วยเหตุนี้ เราจะไม่ใช้ต้นทุนเดิมกับงานทุกประเภททั้งหมด และจะแยกเป็นประเภทการใช้งานและอัตราฮิต แยกคุ้มค่าโปรโมชั่น ราคาปีใหม่ และช่วงพีค-โอฟ เพื่อดูว่าอนาคตราคาจะพลิกกลับหรือไม่
จุดสังเกตคุณภาพ
- เรียกใช้เครื่องมือที่จำเป็นด้วยพารามิเตอร์ที่ถูกต้องเพียงครั้งเดียวหรือไม่
- ไม่เขียนข้อมูลลงในฐานข้อมูลในสถานการณ์ที่ไม่จำเป็นหรือไม่
- ไม่เติมข้อมูลที่ไม่ชัดเจนโดยอัตโนมัติหรือไม่
- สามารถส่งต่อข้อปรึกษาด้านความปลอดภัยให้ผู้รับผิดชอบที่เหมาะสมได้หรือไม่
- แม้หลายภาษา ก็ยังรักษาเงื่อนไขการหยุดที่เหมือนกันหรือไม่
- การเรียกเก็บเงินและการบันทึกสอดคล้องในกระบวนการเดียวหรือไม่
นอกจากความเป็นธรรมชาติของประโยคแล้ว เราจะให้คะแนนที่ความถูกต้องของผลกระทบด้านภายนอก เนื่องจากในงานที่ความผิดพลาดในการบันทึกมีค่าใช้จ่ายในการกู้คืนสูงกว่าความผิดพลาดในการตอบ ดังนั้นลำดับความสำคัญนี้จึงสำคัญ
การตัดสินใจละเว้ยการเปลี่ยนใช้งานจริง
DeepSeek มีต้นทุนที่ถูกกว่า และผ่านการตรวจสอบจริง 21 รายการ แต่ยังมีข้อกำหนดด้านการตรวจสอบคำถามเชิงเทคนิค 2 รายการ การถ่ายทอด zh-TW ยังไม่ตรวจพบ และการบันทึกข้อมูลบางส่วนยังไม่บรรลุ หากเปลี่ยนทั้งระบบพร้อมกันจะยากต่อการระบุสาเหตุ จึงวางแผนเฝ้าระวัง 24 ชั่วโมงจากสายจำเพาะ
การเลือกโมเดลราคาถูกไม่ใช่จุดมุ่งหมาย แต่คือการยังคงความปลอดภัยเท่าเดิมในต้นทุนที่ต่ำลง หากไม่สามารถวัดคุณภาพและความสามารถในการกู้คืนหลังเปลี่ยนได้ คุณจะไม่ใช่เพียงแค่ราคาที่ต่างกันเพื่อให้ใช้งานจริง
หลักการประยุกต์สู่ AI ทางการเงิน
เมื่อเปลี่ยนโมเดลการตัดสินใจของตลาด ก็ไม่ควรตัดสินจากผลกำไรบนการทดสอบย้อนหลังอย่างเดียว ควรเปรียบเทียบการใช้งานจากการเรียกใช้สัญญาณ การระงับ การพารามิเตอร์คำสั่ง การหยุด การขาดล็อก และการล้มเหลวในการสื่อสาร ในการเปลี่ยนแปลงโมเดลจึงควรทำทีละอย่าง
โหลดทดสอบเพิ่มเติมในการเปรียบเทียบครั้งถัดไป
นอกเหนือจากการเปรียบเทียบฟังก์ชัน 60 รูปแบบ ยังจะวัดเวลาตอบสนองเมื่อจำนวนงานพร้อมใช้งานเพิ่มขึ้น อัตราการเกิด 429/5xx การลองอีกครั้งหลังการทำงานซ้ำ และการเปลี่ยนแปลงของแคชในประวัติการสนทนาที่ยาวขึ้น แม้ราคาจะถูก แต่หากในช่วงเวลาพีคการประมวลผลติดขัดจะทำให้เวลารอของผู้ใช้และค่าใช้จ่ายในการลองใหม่สูงขึ้น
นอกจากนี้ จะทำการทดสอบต่อในหลายภาษา รวม zh-TW ที่แสดงความแตกต่างด้วยการถ่ายทอดและประสิทธิภาพการใช้งานเครื่องมือไม่ถูกกระทบ ทั้งอัตราการเรียกใช้งานเครื่องมือ ความเหมาะสมของเป้าหมาย คำถามยืนยันที่ไม่ซ้ำซ้อน และหากการจ่ายเงินเป็นไปในกระบวนการเดียวกัน ค่าเฉลี่ยจะถูกบันทึกพร้อมกับพีเปอร์ไทล์ 95 ของด้านช้า