OpenAI’s o3 model falls short of its own benchmark claims

แหล่งที่มา Cryptopolitan

OpenAI’s newest LLM, o3, is facing scrutiny after independent tests found it solved a far fewer number of tough math problems than the company first claimed. 

When OpenAI unveiled o3 in December, executives said the model could answer “just over a fourth” of the problems in FrontierMath, a notoriously hard set of graduate‑level math puzzles.

The best competitor, they added, was stuck near 2%. “Today, all offerings out there have less than 2%,” Chief Research Officer Mark Chen said during o3 and o3 mini livestream. “We’re seeing, with o3 in aggressive test‑time compute settings, we’re able to get over 25%.”

TechCrunch reported that the result was obtained by OpenAI on a version of o3 that used more computing power than the model the company released last week.

On Friday, the research institute Epoch AI, which created FrontierMath, published its own score for the public o3.

Using an updated 290‑question edition of the benchmark, Epoch put the model at about 10%.

The result does match with a lower‑bound figure in OpenAI’s December technical paper, and Epoch cautioned that the discrepancy could be due to various reasons.

“The difference between our results and OpenAI’s might be due to OpenAI evaluating with a more powerful internal scaffold, using more test‑time computing, or because those results were run on a different subset of FrontierMath,” Epoch wrote.

FrontierMath is designed to measure progress toward advanced mathematical reasoning. The December 2024 public set contained 180 problems, while the February 2025 private update expanded the pool to 290.

Shifts in the question list and the amount of computing power allowed at test time can cause large swings in reported percentages.

OpenAI confirmed the public o3 model uses less compute than the demo version

Evidence that the commercial o3 is lacking also came from tests by the ARC Prize Foundation, which tried an earlier, larger build. The public release “is a different model… tuned for chat/product use,” ARC Price Foundation posted on X, adding that “all released o3 compute tiers are smaller than the version we benchmarked.”

OpenAI employee Wenda Zhou offered a similar explanation during a livestream last week. The production system, he said, was “more optimized for real‑world use cases” and speed. “We’ve done [optimizations] to make the model more cost efficient [and] more useful in general,” Zhou said, while acknowledging possible benchmark “disparities.”

Two smaller models from the company, o3‑mini‑high and the newly announced o4‑mini, already beat o3 on FrontierMath, and OpenAI says a better o3‑pro variant will arrive in the coming weeks.

Still, it shows how benchmark headlines can be misleading. In January, Epoch was criticized for delaying disclosure of OpenAI funding until after o3’s debut. More recently, Elon Musk’s startup xAI was accused of presenting charts that overstated the capabilities of its Grok 3 model.

Industry watchers say such benchmark controversies are becoming an occurrence in the AI industry as companies  race to capture headlines with new models.

Cryptopolitan Academy: Tired of market swings? Learn how DeFi can help you build steady passive income. Register Now

ข้อจำกัดความรับผิดชอบ: เพื่อการอ้างอิงเท่านั้น ผลการดำเนินงานในอดีตไม่ได้บ่งบอกถึงผลลัพธ์ในอนาคต
placeholder
ราคาทองคำพุ่งทะลุ 3,240 ดอลลาร์ เนื่องจากความกังวลเกี่ยวกับสงครามการค้าเพิ่มขึ้น และผลตอบแทนลดลงราคาทองคำปิดตลาดในวันอังคารด้วยแนวโน้มที่สูงขึ้น เนื่องจากนักลงทุนซื้อโลหะมีค่าในช่วงที่มีความไม่แน่นอนเกี่ยวกับแผนการเก็บภาษีของประธานาธิบดีสหรัฐฯ โดนัลด์ ทรัมป์ ซึ่งทำให้ผู้เข้าร่วมตลาดรู้สึกตึงเครียด คู่ XAU/USD ซื้อขายที่ $3,240 ต่อออนซ์ ทองคำเพิ่มขึ้นกว่า 6.50%
ผู้เขียน  FXStreet
4 เดือน 16 วัน พุธ
ราคาทองคำปิดตลาดในวันอังคารด้วยแนวโน้มที่สูงขึ้น เนื่องจากนักลงทุนซื้อโลหะมีค่าในช่วงที่มีความไม่แน่นอนเกี่ยวกับแผนการเก็บภาษีของประธานาธิบดีสหรัฐฯ โดนัลด์ ทรัมป์ ซึ่งทำให้ผู้เข้าร่วมตลาดรู้สึกตึงเครียด คู่ XAU/USD ซื้อขายที่ $3,240 ต่อออนซ์ ทองคำเพิ่มขึ้นกว่า 6.50%
placeholder
ราคาทองคำพุ่งขึ้นทำสถิติสูงสุดใหม่ เนื่องจากความตึงเครียดทางการค้าทำให้ดอลลาร์สหรัฐอ่อนค่าลงราคาทองคำขยายสถิติการปรับตัวขึ้นเป็นครั้งที่สามในสัปดาห์ เนื่องจากเงินดอลลาร์อ่อนค่าลงจากความตึงเครียดระหว่างจีนและสหรัฐอเมริกาเกี่ยวกับนโยบายการค้า ความตึงเครียดเหล่านี้ทำให้สินทรัพย์ปลอดภัยเช่นโลหะมีค่ามีความน่าสนใจมากขึ้น
ผู้เขียน  FXStreet
4 เดือน 17 วัน พฤหัส
ราคาทองคำขยายสถิติการปรับตัวขึ้นเป็นครั้งที่สามในสัปดาห์ เนื่องจากเงินดอลลาร์อ่อนค่าลงจากความตึงเครียดระหว่างจีนและสหรัฐอเมริกาเกี่ยวกับนโยบายการค้า ความตึงเครียดเหล่านี้ทำให้สินทรัพย์ปลอดภัยเช่นโลหะมีค่ามีความน่าสนใจมากขึ้น
placeholder
ราคาทองคำปรับตัวลงต่ำกว่า 3,300 ดอลลาร์หลังจากทำสถิติสูงสุด ขณะที่พาวเวลล์ชี้ให้เห็นถึงความเสี่ยงของภาวะเศรษฐกิจถดถอยและเงินเฟ้อทองคำปรับตัวลดลงในวันพฤหัสบดี ก่อนวันหยุดอีสเตอร์วันศุกร์ดี โดยลดลง 0.60% หลังจากที่เคยปรับตัวขึ้นเกือบ $400 ในช่วงเจ็ดวันที่ผ่านมา เนื่องจากความไม่แน่นอนเกี่ยวกับนโยบายการค้าของสหรัฐฯ (US) /USD ซื้อขายที่ $3,319 หลังจากทำสถิติสูงสุดที่ $3,357 ในช่วงต้นสัปดาห์
ผู้เขียน  FXStreet
4 เดือน 18 วัน ศุกร์
ทองคำปรับตัวลดลงในวันพฤหัสบดี ก่อนวันหยุดอีสเตอร์วันศุกร์ดี โดยลดลง 0.60% หลังจากที่เคยปรับตัวขึ้นเกือบ $400 ในช่วงเจ็ดวันที่ผ่านมา เนื่องจากความไม่แน่นอนเกี่ยวกับนโยบายการค้าของสหรัฐฯ (US) /USD ซื้อขายที่ $3,319 หลังจากทำสถิติสูงสุดที่ $3,357 ในช่วงต้นสัปดาห์
placeholder
USD/JPY อ่อนค่าลงต่ำกว่า 142.50 เนื่องจาก CPI ของญี่ปุ่นอยู่ที่ 3.6% YoY ในเดือนมีนาคมคู่ USDJPY อ่อนค่าลงใกล้ 142.25 ในช่วงการซื้อขายที่มีวอลลุ่มต่ำในวันศุกร์ ดอลลาร์สหรัฐ (USD) ขยับลงเมื่อเทียบกับเงินเยนของญี่ปุ่น (JPY) ท่ามกลางความกังวลเกี่ยวกับผลกระทบทางเศรษฐกิจจากภาษี
ผู้เขียน  FXStreet
4 เดือน 18 วัน ศุกร์
คู่ USDJPY อ่อนค่าลงใกล้ 142.25 ในช่วงการซื้อขายที่มีวอลลุ่มต่ำในวันศุกร์ ดอลลาร์สหรัฐ (USD) ขยับลงเมื่อเทียบกับเงินเยนของญี่ปุ่น (JPY) ท่ามกลางความกังวลเกี่ยวกับผลกระทบทางเศรษฐกิจจากภาษี
placeholder
คาดการณ์ XAUUSD: ราคาทองคำพุ่งใกล้ $3,350 จากความไม่แน่นอนเกี่ยวกับนโยบายภาษีของทรัมป์ราคาทองคํา (XAU/USD) ปรับตัวสูงขึ้นใกล้ $3,350 ในช่วงเช้าของตลาดลงทุนเอเชียวันจันทร์ หลังจากเผชิญกับการปิดออเดอร์เพื่อทำกำไรจากวันหยุดยาว ความไม่แน่นอนเกี่ยวกับนโยบายภาษีของประธานาธิบดีสหรัฐฯ โดนัลด์ ทรัมป์ และความตึงเครียดทางภูมิศาสตร์ที่ยังคงมีอยู่ ยังคงสนับสนุนราคาทองคำ
ผู้เขียน  FXStreet
5 ชั่วโมงที่แล้ว
ราคาทองคํา (XAU/USD) ปรับตัวสูงขึ้นใกล้ $3,350 ในช่วงเช้าของตลาดลงทุนเอเชียวันจันทร์ หลังจากเผชิญกับการปิดออเดอร์เพื่อทำกำไรจากวันหยุดยาว ความไม่แน่นอนเกี่ยวกับนโยบายภาษีของประธานาธิบดีสหรัฐฯ โดนัลด์ ทรัมป์ และความตึงเครียดทางภูมิศาสตร์ที่ยังคงมีอยู่ ยังคงสนับสนุนราคาทองคำ
goTop
quote