<?xml version="1.1" encoding="utf-8"?>
<article xsi:noNamespaceSchemaLocation="http://jats.nlm.nih.gov/publishing/1.1/xsd/JATS-journalpublishing1-mathml3.xsd" dtd-version="1.1" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"><front><journal-meta><journal-id journal-id-type="publisher-id">JERA</journal-id><journal-title-group><journal-title>Journal of Electronic Research and Application</journal-title></journal-title-group><issn>2208-3502</issn><eissn>2208-3510</eissn><publisher><publisher-name>Bio-Byword Scientific Publishing Pty. Ltd.</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.26689/jera.v10i5.15281</article-id><article-categories><subj-group subj-group-type="heading"><subject>Article</subject></subj-group></article-categories><title>Answer Distribution Bias in OmniBench: How Answer-Position Skew Affects Multimodal Large Language Model Evaluation</title><url>https://artdesignp.com/journal/JERA/10/5/10.26689/jera.v10i5.15281</url><author>WanSai</author><pub-date pub-type="publication-year"><year>2026</year></pub-date><volume>10</volume><issue>5</issue><history><date date-type="pub"><published-time>2026-06-29</published-time></date></history><abstract>OmniBench is a widely used tri-modal (image–audio–text) benchmark containing 1,142 four-choice multiple-choice questions. We discover a severe answer-position skew in OmniBench: option D is correct 48.6% of the time (χ² = 384.34, p = 5.46×10⁻⁸³), nearly twice the expected 25%. To test whether this skew distorts evaluation outcomes, we design an option-shuffling experiment: keeping all question content unchanged, we randomly reassign letter labels so that the correct answer is uniformly distributed (D ≈ 25%), then re-evaluate the same models. Results show that accuracy changes significantly in two of three tested models after shuffling (up to 4.20%, p &amp;lt; 0.01), demonstrating that unequal answer distribution can significantly bias model evaluation outcomes. Furthermore, we propose a label-free content-scoring evaluation method based on conditional log-probability, which achieves distribution-invariant evaluation (accuracy difference ≤ 0.18%, p &amp;gt; 0.4).</abstract><keywords/></article-meta></front><body/><back><ref-list><ref id="B1" content-type="article"><label>1</label><element-citation publication-type="journal"><p>Li Y, Wu B, Zhao F, et al., 2024, OmniBench: Towards the Future of Universal Omni-Language Models, arXiv preprint arXiv:2409.15272.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B2" content-type="article"><label>2</label><element-citation publication-type="journal"><p>Yue X, Ni Y, Zhang K, et al., 2023, MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI, Proceedings of CVPR 2024. arXiv:2311.16502.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B3" content-type="article"><label>3</label><element-citation publication-type="journal"><p>Liu Y, Duan H, Zhang Y, et al., 2023, MMBench: Is Your Multi-modal Model an All-around Player? Proceedings of ECCV 2024. arXiv:2307.06281.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B4" content-type="article"><label>4</label><element-citation publication-type="journal"><p>Fu C, Chen P, Shen Y, et al., 2023, MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models, arXiv preprint arXiv:2306.13394.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B5" content-type="article"><label>5</label><element-citation publication-type="journal"><p>Wang B, Zou X, Lin G, et al., 2024, AudioBench: A Universal Benchmark for Audio Large Language Models, arXiv preprint arXiv:2406.16020.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B6" content-type="article"><label>6</label><element-citation publication-type="journal"><p>Pezeshkpour P, Hruschka E, 2023, Large Language Models Sensitivity to the Order of Options in Multiple-Choice Questions, Findings of NAACL-HLT 2024. arXiv:2308.11483.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B7" content-type="article"><label>7</label><element-citation publication-type="journal"><p>Zheng C, Zhou H, Meng F, et al., 2023, Large Language Models Are Not Robust Multiple Choice Selectors, Proceedings of ICLR 2024 (Spotlight). arXiv:2309.03882</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B8" content-type="article"><label>8</label><element-citation publication-type="journal"><p>Zhao Z, Wallace E, Feng S, et al., 2021, Calibrate Before Use: Improving Few-Shot Performance of Language Models, Proceedings of ICML 2021. arXiv:2102.09690.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B9" content-type="article"><label>9</label><element-citation publication-type="journal"><p>Zhou H, Wan X, Proleev L, et al., 2023, Batch Calibration: Rethinking Calibration for In-Context Learning and Prompt Engineering, Proceedings of ICLR 2024. arXiv:2309.17249.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B10" content-type="article"><label>10</label><element-citation publication-type="journal"><p>Yue X, Zheng T, Zhang K, et al., 2024, MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark, arXiv preprint arXiv:2409.02813.</p><pub-id pub-id-type="doi"/></element-citation></ref></ref-list></back></article>
