Voitot:
- Kyky raportoida empiirisiä havaintoja kohdeyleisölle (akateemiselle, politiikalle, johdolle) tekoälyn tuella rehellisesti ja yksiselitteisellä kielellä
- Kyky kirjoittaa täydellisesti johtopäätökset, rajoitukset ja eettiset lausunnot (tietojen luottamuksellisuus, eturistiriita, tekoälyn käytön paljastaminen) ja välttää harhaanjohtavaa esitystä
- Tekoälyn kyky tunnistaa raporttiluonnoksia, jotka tuottavat liioiteltua, yksipuolista tai kausaalista kieltä, ja ylläpitää, että vastuu lopullisesta tekstistä ja väitteistä on tutkijalla.
Moduulin tentti
1. Tutkija kysyy "Mikä on korrelaatiokerroin työttömyyden ja inflaation välillä Türkiyessä vuosina 2015-2020?" antamatta mitään tietoja tekoälylle. hän kysyy ja kirjoittaa luvun 0,62 suoraan artikkeliinsa. Mikä on perustavanlaatuinen virhe tässä lähestymistavassa?
- A) Odotetaan tekoälyltä konkreettisia tilastoja antamatta varmennettuja tietoja; ✔ Käyttämällä numeroa, joka on ehkä keksitty vahvistamatta sitä
- B) Korrelaatiokerrointa ei tule koskaan käyttää artikkelissa.
- C) Työttömyyden ja inflaation välistä korrelaatiota ei voida laskea
- D) Tekoäly pääsee tietoihin vasta vuoden 2020 jälkeen
Selitys: AI-kielimalli ei voi tuottaa tilastoja ilman tietojoukkoa. Hänen antamansa numero on todennäköisesti hallusinaatio (kehitetty). Kertoimet, suhteet ja testitulokset tulee laskea tutkijan omasta varmennetusta tiedosta, ei mallin muistista.
2. Mitä puuttuvien tietojen merkintä "ei puuttuu satunnaisesti" (MNAR) tarkoittaa ja miksi se on tärkeää?
- A) Puute johtuu itse havaitsemattomasta arvosta; Siksi yksinkertainen tehtävä voi aiheuttaa harhaa ✔
- B) Tiedot katoavat täysin satunnaisesti eikä aiheuta harhaa.
- C) Puuttuvat tiedot tulee aina korjata poistamalla rivi.
- D) Puuttuvat tiedot eivät vaikuta analyysiin millään tavalla.
Selitys: MNAR:n (Missing Not At Random) tapauksessa itse puuttuminen riippuu havaitsemattoman arvon suuruudesta (esim. korkeatuloiset eivät ilmoita tulojaan). Tässä tapauksessa yksinkertainen poisto tai keskimääräinen määritys antaa puolueellisia tuloksia; Puutteen mekanismi on mallinnettava. Tekoälyn ehdottamaa määritysmenetelmää ei pidä soveltaa sokeasti tätä mekanismia tuntematta.
3. Analyytikko pyytää tekoälyä tekemään pylväskaavion, ja tekoäly aloittaa y-akselin 40:stä nollan sijaan. Todellinen 2 prosentin ero näiden kahden ryhmän välillä näyttää kaaviossa valtavalta. Mikä on oikea lähestymistapa?
- A) Akselin aloittaminen tyhjästä tai karttatyypin muuttaminen; ✔ näyttää eron todellisen koon harhaanjohtamatta
- B) Kaavion käyttäminen sellaisenaan, koska tekoäly tekee parhaan valinnan
- C) Aloita akseli 45:stä eron lisäämiseksi
- D) Älä koskaan käytä grafiikkaa pylväskaavioiden sijasta
Selitys: Pylväskaaviossa katkoviiva (y-akseli, joka ei ala nollasta) johtaa harhaan liioittelemalla pieniä eroja. Rehellisessä visualisoinnissa pylväskaavioiden akselin tulee alkaa nollasta tai ero tulee tietoisesti ilmaista selkeästi. Analyytikon vastuulla on tarkastaa kuva ja korjata se tarvittaessa.
4. Miten se tosiasia, että kerroin on 'merkittävä' (p<0,05) lineaarisessa regressiossa, esitetään usein väärin tekoälyn tulkinnassa?
- A) Liioiteltu merkityksen esittäminen, koska vaikutus on suuri ja tärkeä tai syy-yhteys on todettu ✔
- B) Merkitys osoittaa aina, että vaikutus on pieni
- C) p<0,05 osoittaa, että kerroin on ehdottoman oikea
- D) Merkittäviä kertoimia ei saa koskaan ilmoittaa.
Selitys: Tilastollinen merkitsevyys liittyy todisteiden vahvuuteen siitä, että vaikutus eroaa nollasta; Se ei tarkoita, että vaikutus olisi suuri, tärkeä tai kausaalinen. Tekoäly esittää usein sanan "merkittävä" muodossa "merkittävä/voimakas vaikutus". Tutkijan tulee myös arvioida vaikutuksen koko, luottamusväli ja konteksti.
5. Mihin termi "p-hakkerointi" viittaa ja miksi tekoäly voi helpottaa sitä?
- A) Useiden analyysien kokeilu, kunnes se on järkevää; Tekoäly tekee tämän erittäin nopeasti, mikä lisää riskiä ✔
- B) Datan analysointi kerran ja ennalta määrätyllä suunnitelmalla
- C) otoksen laajentaminen p-arvon kasvattamiseksi
- D) Vain kuvailevien tilastojen ilmoittaminen
Selitys: p-hakkerointi yrittää erilaisia muuttujia, osanäytteitä, muunnoksia tai malleja, kunnes saadaan mielekäs tulos; tämä tuottaa vääriä löydöksiä sattuman perusteella. Koska tekoäly voi kokeilla kymmeniä malliversioita sekunneissa, se voi nopeuttaa p-hakkerointia ilman rehellistä suunnitelmaa. Puolustus; ennakkoilmoittautuminen, kiinteä analyysisuunnitelma ja usean vertailun korjaus.
6. Miksi suuren R-neliön regression löytäminen kahden ei-stationaarisen (yksikköjuuri) aikasarjan välillä voi olla harhaanjohtavaa?
- A) Harhaanjohtavaa regressiota voi esiintyä yleisen trendin vuoksi; ✔ Korkea R-neliön lähtö ilman todellista suhdetta
- B) Korkea R-neliö osoittaa aina vahvan syy-yhteyden.
- C) Ei-stationaarisia sarjoja ei voida syöttää regressioon ollenkaan.
- D) R-neliötä ei voida laskea aikasarjoissa
Selitys: Jos ei-stationaaristen sarjojen välillä ei ole yhteistä kointegraatiosuhdetta, harharegressio voi tuottaa korkean R-neliön ja merkitsevän kertoimen vain yhteisestä trendistä johtuen; kun taas todellista suhdetta ei ole. Siksi ensin tulee tehdä stationaarisuus- ja yksikköjuuritestit ja tarvittaessa ottaa erot tai testata kointegraatiota.
7. Mikä perusoletus perustuu Difference-in-Differences -mallin validiteettiin?
- A) Rinnakkaistrendioletus: ryhmät seuraisivat samaa suuntaa, jos puuttumista ei olisi ✔
- B) Hoito- ja kontrolliryhmät ovat alussa täsmälleen samat
- C) Näytteen normaalijakauma
- D) Muuttujat eivät sisällä puuttuvia tietoja
Selitys: DiD olettaa, että ilman interventiota hoito- ja kontrolliryhmien tulosmuuttuja olisi kulkenut samansuuntaisesti ajan myötä (oletus samansuuntaisista trendeistä). Jos tämä oletus ei täyty, arvio on puolueellinen. Tekoäly voi tuottaa DiD-koodin, mutta tutkijan tehtävä on puolustaa ja testata rinnakkaisia trendejä.
8. Mikä seuraavista on pakollinen käytäntö toistettavan analyysin kannalta?
- A) Siemenen kiinnitys satunnaisissa vaiheissa, pakkausversioiden ja koodin tallentaminen ✔
- B) Kopioi tulokset manuaalisesti laskentataulukkoon ja poista koodi
- C) On normaalia nähdä erilaisia tuloksia jokaisessa ajossa.
- D) Säilytetään vain lopullinen grafiikka, ei tietojen ja koodin jakamista
Kuvaus: Toistettavuus; Sama tulos voidaan saada uudelleen samalla datalla ja koodilla. Siemenen korjaaminen satunnaisissa vaiheissa, pakettiversioiden tallentaminen ja koodin suorittaminen dokumentissa (lukutaitoinen ohjelmointi) ovat tämän kulmakiviä. Tulosten kopioiminen manuaalisesti tai napsautuskohtaisesti kirjaamattomien vaiheiden osalta heikentää toistettavuutta.
9. Mitä heteroskedastisuus vääristää lineaarista regressiota ja mikä on sen yleinen ratkaisu?
- A) Se vääristää standardivirheitä; ratkaisu on vankka standardivirhe tai sopiva muunnos ✔
- B) Se mitätöi kertoimen estimaatit täysin eikä sillä ole ratkaisua
- C) Pienentää R-neliön aina nollaan
- D) Esiintyy vain, jos näyte on hyvin pieni ja se voidaan jättää huomiotta
Selitys: Heteroskedastisuus jättää kertoimen estimaatit puolueettomiksi, mutta laskee keskivirheet väärin; Tämä tekee p-arvoista ja luottamusvälistä epäluotettavia. Yleinen ratkaisu on käyttää robust/HC-standardivirheitä tai asianmukaista muuntamista. On varmistettava, että tekoälyn ehdottama ratkaisu todella korjaa ongelman sen sijaan, että se piilottaisi sen.
10. Tutkija lataa potilastason tunnistustiedot ja tulot sisältävän mikrodatan julkiseen tekoäly-chat-työkaluun ja sanoo "tee regressio". Mikä on tämän käytöksen suurin ongelma?
- A) Henkilötietojen/lisensoitujen tietojen lataaminen ulkoiseen työkaluun rikkoo luottamuksellisuutta ja sopimusta ✔
- B) Regressiota ei voi tehdä tekoälyllä ollenkaan
- C) Mikrodata ei sovellu regressioon ollenkaan
- D) AI laskee aina regression väärin
Selitys: Henkilötiedot/erityistiedot, kuten henkilöllisyys ja tulot, on suojattu KVKK/GDPR:n ja useimpien tietojen käyttösopimusten mukaisesti. Niiden lataaminen ulkoiseen laitteeseen, joka voi tallentaa tietoja, on rikkomus. Oikea tapa; Tietojen anonymisointi, paikallisten/instituutioiden suojattujen työkalujen käyttäminen tai yksinkertaisesti koodin pyytäminen tekoälyltä ja koodin käyttäminen omassa ympäristössään.
11. Mitä havaitaan, kun multikollineaarisuus on korkea?
- A) Kertoimet muuttuvat epävakaiksi ja standardivirheet kasvavat; Yksittäiset kertoimet voivat osoittautua merkityksettömiksi ✔
- B) R-neliö pienenee aina nollaan
- C) Kerroinarviot tarkentuvat koko ajan
- D) Riippuvaisen muuttujan asteikko muuttuu
Selitys: Korkeassa multikollineaarisuudessa riippumattomat muuttujat korreloivat voimakkaasti keskenään; Kerroinestimaatit muuttuvat epävakaiksi, standardivirheet paisuvat ja yksittäiset kertoimet voivat osoittautua merkityksettömiksi, kun taas kokonaismalli voi olla merkittävä. Se diagnosoidaan kriteereillä, kuten VIF. Tekoäly voi ehdottaa muuttujan eliminointia, mutta tutkijan on päätettävä, mikä muuttuja jää teoreettiseksi.
12. Mikä on tilastollinen teho ja mikä on pienitehoisen tutkimuksen riski?
- A) Mahdollisuus havaita olemassa oleva vaikutus; pieni teho jättää huomiotta todelliset vaikutukset ja tekee havainnoista epäluotettavia ✔
- B) p-arvon pienenemisen todennäköisyys; pienempi teho antaa aina luotettavampia tuloksia
- C) Vakioarvo, joka on riippumaton otoksen koosta
- D) Käsite, joka pätee vain, kun käytetään tekoälyä
Selitys: Teho on todennäköisyys havaita todella olemassa oleva vaikutus (1 miinus tyypin II virhe). Vähätehoisista tutkimuksista voi jäädä paitsi todelliset vaikutukset; Lisäksi harvoilla merkittävillä tuloksilla voi olla liioiteltu vaikutus ("voittajan kirous") ja väärien positiivisten tulosten määrä kasvaa. Siksi teho/näytelaskenta on tärkeää ennen analyysiä.
13. Miksi on eettisesti välttämätöntä paljastaa tekoälyn käyttö artikkelissa?
- A) Avoimuus ja vastuullisuus; ✔ Lukijat ja tuomarit voivat arvioida prosessia ja vastuu jää kirjoittajalle
- B) Tekoälyn käyttö mitätöi tulokset automaattisesti
- C) Aikakauslehdet pyytävät vain mainostarkoituksiin
- D) Selityksen tekijänoikeuden siirtäminen tekoälylle
Tietojen paljastaminen: Avoimuus on välttämätöntä, jotta lukija ja arvioijat voivat arvioida, kuinka tulokset tuotettiin; Monet lehdet ja laitokset vaativat nyt tekoälyn käytön paljastamista. Lisäksi, koska tekoäly voi tuottaa virheitä/hallusinaatioita, on rehellistä sanoa, että vastuu on tekijällä ja mitkä vaiheet auditoitiin.
14. Mitä "poissulkemisrajoitus" vaatii instrumenttimuuttujan (IV) menetelmässä?
- A) Työkalu vaikuttaa tulokseen vain sisäisen muuttujan kautta, muuta suoraa tapaa ei ole ✔
- B) Instrumentilla ei ole yhteyttä tulosmuuttujaan.
- C) Instrumentti ei liity endogeeniseen muuttujaan.
- D) Means on aina binäärinen (0/1) muuttuja
Selitys: Poissulkemisrajoitus edellyttää, että instrumentti vaikuttaa tulosmuuttujaan vain endogeenisen selittävän muuttujan kautta, ei muiden suorien keinojen tai havaitsemattomien tekijöiden kautta. Tätä oletusta ei voida täysin testata tiedoista; Sitä puolustetaan teoreettisin ja institutionaalisin perustein. Tekoäly voi kirjoittaa IV-koodin, mutta tutkijan tehtävä on puolustaa työkalun pätevyyttä.
15. Mitä 'Haarukkapolkujen puutarha' -ongelma tarkoittaa joustavissa analyyseissä ilman ennakkoilmoittautumista?
- A) Liian monet aineiston perusteella tehdyt järkevät analyysivalinnat lisäävät väärän positiivisuuden määrää, jopa tahattomasti ✔
- B) Analyysimenetelmien tulee olla yksittäisiä ja pakollisia
- C) Ongelma, joka ilmenee vain, kun tapahtuu tahallinen huijaus.
- D) Tilanne, joka katoaa spontaanisti näytteen kasvaessa
Selitys: Datan tarkastelun jälkeen tutkija voi tehdä monia järkeviä valintoja käytettävän muuttujan, alaryhmän, muunnoksen tai kynnyksen suhteen. Vaikka yksittäistä "tahallista p-hakkerointia" ei olisikaan, tämä joustavuus lisää väärien positiivisten osuutta, koska merkittävä valitaan tehokkaasti useiden analyysien joukosta. Ennakkoilmoittautuminen ja kiinteä analyysisuunnitelma rajoittavat tätä joustavuutta.