29 de setembre 2026

La integritat científica en dubte

 The Credibility Crisis in Science

El llibre The Credibility Crisis in Science (MIT Press), escrit pels professors Thomas Plümper i Eric Neumayer, analitza les causes, mecanismes i possibles solucions a la crisi de credibilitat que pateixen les ciències empíriques.

A diferència dels enfocaments tradicionals que es concentren exclusivament en els casos extrems de dades inventades o falsificades, els autors sostenen que la gran amenaça per a la integritat científica és el tweaking (els retocs o ajustos selectius en el disseny de la recerca i l'especificació dels models).

El llibre s'estructura en tres parts principals:

Part I: Is Science Broken? (Està la ciència trencada?)

  • Definició de frau científic: Els autors argumenten que el frau no s'ha de definir pel mètode utilitzat, sinó per la intenció de manipular quantitats d'interès estadístic per obtenir un benefici personal o acadèmic (com publicar en revistes d'alt impacte, obtenir finançament o confirmar biaixos ideològics). Un resultat manipulat no és necessàriament fals, però la pràctica és enganyosa i fraudulenta.
  • Tres nivells de manipulació:
    1. Fabricació de dades: Inventar informació sense haver fet la recerca.
    2. Manipulació de dades: Alterar o substituir valors en un conjunt de dades real.
    3. Tweaking (Ajustos o retocs): Seleccionar o canviar subtilment el disseny de la recerca, la mostra o l'especificació del model fins a trobar un resultat "publicable" (per exemple, \(p < 0.05\)) i ocultar les altres especificacions provades.
  • L'amenaça del tweaking: Tot i que la fabricació i la manipulació de dades són greus, són relativament rares i més fàcils de detectar. El tweaking és extremadament comú, gairebé indistinguible de la recerca honesta i pràcticament impossible de provar en casos individuals, fent que l'impacte acumulat sobre la ciència sigui molt més devastador.
  • Motius dels fraudulents: El llibre identifica diferents motivacions: la pressió del sistema acadèmic (publish or perish), la cerca de reconeixement i promocions, la necessitat de reduir el desordre de les dades reals i, sobretot, el biaix de confirmació o la dissonància cognitiva quan els dades no quadren amb les idees de l'investigador.

Part II: Researcher Degrees of Freedom (Els graus de llibertat de l'investigador)

Els autors analitzen com s'exploten els "graus de llibertat de l'investigador" en diferents metodologies:

  1. Anàlisi de dades observacionals:
    • S'aprofita la incertesa del model per provar múltiples combinacions de variables de control, transformacions de variables o filtratges de la mostra (data trimming).
    • S'utilitza el HARK-ing (Hypothesizing After Results are Known / formular hipòtesis un cop es coneixen els resultats) per presentar correlacions fortuïtes com si fossin descobriments teòrics.
    • Exemples analitzats: L'estudi de Jung et al. que afirmava que els huracans amb nom femení maten més gent (fràgil davant petits canvis de mostra o especificació), o la troballa de Reinhart i Rogoff sobre el límit del 90% de deute/PIB.
  2. Dissenys experimentals:
    • Tot i que els experiments redueixen la incertesa del model, donen als investigadors un control gairebé total sobre el disseny i la recollida de dades privades.
    • S'utilitzen estratègies de "pesca" (fishing), com provar múltiples tractaments o resultats i reportar només aquells que donen significatius, o repetir un experiment fins que un intent surt favorable.
    • Exemples analitzats: Els "pizza papers" de Brian Wansink, els experiments de parapsicologia de Daryl Bem sobre la percepció del futur i manipulacions de mostres en jocs del dictador.
  3. Models causals (quasi-experimentals):
    • Mètodes com el Matching, el disseny de discontinuïtat de regressió (RDD), les variables instrumentals o el Difference-in-Differences no eliminen la dependència del model, sinó que la s'amaguen.
    • Els investigadors poden triar l'ample de banda (bandwidth), les variables instrumentals o el grup de control sintètic que produeixi l'efecte causal desitjat.
    • Exemple analitzat: L'estudi de Kristian Holden sobre l'impacte dels subsidis de llibres de text a Califòrnia, on els efectes desapareixen quan s'apliquen canvis de mostra o especificacions dinàmiques adequades.

Part III: Countering Fraud (Afrontar i combatre el frau)

Els autors analitzen les solucions actuals basant-se en tres pilars:

  • Dissuasió (Deterrence): Les sancions acadèmiques o la criminalització del frau tenen un efecte molt limitat perquè la probabilitat de ser detectat és extremadament baixa. Els alertadors (whistleblowers) paguen un preu social i professional molt alt i pateixen sovint represàlies.
  • Prevenció (Prevention): La formació en ètica no atura els fraudulents conscients. La preregistració de projectes ajuda en experiments, però no és una solució universal: no s'adapta bé a la recerca observacional i pot ser esquivada mitjançant proves prèvies no declarades.
  • Detecció (Detection): Les eines d'anàlisi d'imatges (pixel peeping com el d'Elisabeth Bik), la llei de Benford o les p-curves poden identificar anomalias, però poques vegades poden demostrar la intenció fraudulenta d'un cas individual de tweaking.

La proposta dels autors

Atès que provar la intenció de frau és gairebé impossible, els autors proposen canviar el focus: no es tracta de demostrar la deshonestedat, sinó d'avaluar la robustesa dels resultats.

  1. Transparència brutal de les dades: Proposen un esquema de classificació de transparència de dades on s'exigeixi compartir tant les dades brutes com el codi de transformació i la mostra final de replicació.
  2. Proves de robustesa obligatòries i dirigides per revisors: La fragilitat d'un resultat indica un alt grau de tweakability. Per evitar que els autors triïn únicament les proves de robustesa que els afavoreixen, els editors i revisors de les revistes han de determinar quines proves de robustesa alternatives s'han d'executar abans d'acceptar un article.