<?xml version="1.1" encoding="utf-8"?>
<article xsi:noNamespaceSchemaLocation="http://jats.nlm.nih.gov/publishing/1.1/xsd/JATS-journalpublishing1-mathml3.xsd" dtd-version="1.1" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"><front><journal-meta><journal-id journal-id-type="publisher-id">SSR</journal-id><journal-title-group><journal-title>Scientific and Social Research</journal-title></journal-title-group><issn>2661-4332</issn><eissn>2981-9946</eissn><publisher><publisher-name>Bio-Byword Scientific Publishing Pty. Ltd.</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.26689/ssr.v7i11.13040</article-id><article-categories><subj-group subj-group-type="heading"><subject>Article</subject></subj-group></article-categories><title>A Many-Facet Rasch Model Analysis of Rater-Criterion Interaction in the Assessment of Student Post-Machine Translation Editing Competence</title><url>https://artdesignp.com/journal/SSR/7/11/10.26689/ssr.v7i11.13040</url><author>TianChun-guang</author><pub-date pub-type="publication-year"><year>2025</year></pub-date><volume>7</volume><issue>11</issue><history><date date-type="pub"><published-time>2025-12-12</published-time></date></history><abstract>With the advancement of machine translation, post-editing (PE) has become a dominant workflow, making the accurate assessment of post-machine translation editing competence (PMTE) critical. However, performance-based PMTE assessments are vulnerable to subjective rater effects, compromising their validity. This study employs the Many-Facet Rasch model (MFRM) to conduct an in-depth analysis of rater-criterion interaction, a complex bias in PMTE evaluation. The research involved 144 examinees translating a scientific text and four expert raters assessing the outputs using four criteria: Logical relations, completeness, terminology, and fluency. The MFRM analysis successfully calibrated examinee ability, demonstrating high reliability (.86), and revealed significant variations in rater severity and criterion difficulty. Critically, the analysis identified specific quality control issues, including inconsistent scoring by one rater and ambiguity in the “Terminology” criterion. The bias analysis uncovered significant rater-criterion interactions. These findings demonstrate that MFRM is a powerful diagnostic tool that transforms assessment from a purely evaluative act into a mechanism for data-driven improvement. It provides objective, actionable evidence for refining scoring rubrics and conducting targeted rater training, thereby enhancing the fairness and validity of PMTE assessment.</abstract><keywords/></article-meta></front><body/><back><ref-list><ref id="B1" content-type="article"><label>1</label><element-citation publication-type="journal"><p>Lommel A, Melby AK, 2018, MQM-DQF: A Good Marriage (Translation Quality for the 21st Century). In Proceedings of the 21st Annual Conference of the European Association for Machine Translation, 21–30.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B2" content-type="article"><label>2</label><element-citation publication-type="journal"><p>Robert IS, Schrijver I, Ureel JJ, 2022, Measuring Translation Revision Competence and Post-editing Competence in Translation Trainees: Methodological Issues. The Interpreter and Translator Trainer, 16(3): 329–349.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B3" content-type="article"><label>3</label><element-citation publication-type="journal"><p>Myford CM, Wolfe EW, 2003, Detecting and Measuring Rater Effects Using Many-Facet Rasch Measurement: Part I. Journal of Applied Measurement, 4(4): 386–422.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B4" content-type="article"><label>4</label><element-citation publication-type="journal"><p>Boone WJ, 2016, Rasch Analysis for Instrument Development: Why, When, and How. CBE—Life Sciences Education, 15(4): ar54.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B5" content-type="article"><label>5</label><element-citation publication-type="journal"><p>Nitzke J, 2019, Risk Management and Post-editing Competence. The Journal of Specialised Translation, 2019(31): 126–146.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B6" content-type="article"><label>6</label><element-citation publication-type="journal"><p>Myford CM, Wolfe EW, 2004, Detecting and Measuring Rater Effects Using Many-Facet Rasch Measurement: Part II. Journal of Applied Measurement, 5(2): 189–227.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B7" content-type="article"><label>7</label><element-citation publication-type="journal"><p>Eskin D, 2023, A Many-Facets Rasch Analysis of Facet Main Effects and Interactions in a Writing Assessment. Journal of Applied Measurement, 24(1): 1–16.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B8" content-type="article"><label>8</label><element-citation publication-type="journal"><p>Dismukes RK, 2000, Multifacet Rasch Analysis of Rater Training Effects on Scoring Performance. American Institutes for Research.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B9" content-type="article"><label>9</label><element-citation publication-type="journal"><p>Linacre JM, 1989, Many-facet Rasch Measurement. MESA Press.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B10" content-type="article"><label>10</label><element-citation publication-type="journal"><p>Eckes T, 2019, Many-facet Rasch Measurement: Implications for Rater-mediated Language Assessment. In Quantitative Data Analysis for Language Assessment Volume II. Routledge, London, 122–145.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B11" content-type="article"><label>11</label><element-citation publication-type="journal"><p>Han C, 2015, Investigating Rater Severity/Leniency in Interpreter Performance Testing: A Multifaceted Rasch Measurement Approach. Interpreting, 17(2): 225–251.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B12" content-type="article"><label>12</label><element-citation publication-type="journal"><p>Tseng WT, Su ZY, Nix JML, 2019, Validating Translation Test Items via the Many-facet Rasch Model. Psychological Reports, 122(2): 748–772.</p><pub-id pub-id-type="doi"/></element-citation></ref><ref id="B13" content-type="article"><label>13</label><element-citation publication-type="journal"><p>House J, 2015, Translation Quality Assessment: Past and Present. Routledge, London.</p><pub-id pub-id-type="doi"/></element-citation></ref></ref-list></back></article>
