Μονάδες
1. Ο νέος συνεργάτης της δημοσιογραφίας: Ρόλοι, όρια και αντανακλαστικό επαλήθευσης 2. Ανάλυση Δεδομένων στην Ερευνητική Δημοσιογραφία: Μετατροπή Στοίβων Εγγράφων σε Ειδήσεις 3. Μεταγραφή και ανάλυση ήχου/βίντεο: Συνεντεύξεις σε κείμενο, κείμενο σε ειδήσεις 4. Επαλήθευση και επιβεβαίωση πηγής (Έλεγχος γεγονότων): Από αξίωση σε αποδεικτικά στοιχεία 5. Παραπληροφόρηση και Συνθετικό Περιεχόμενο: Η δημοσιογραφία στην εποχή του Deepfake 6. Γράψιμο ειδήσεων: Από το σχέδιο στη δημοσίευση, από την ανεστραμμένη πυραμίδα στην επικεφαλίδα 7. Σύνοψη, ενημέρωση και επανασυσκευασία περιεχομένου 8. Πολύγλωσση Δημοσιογραφία: Μετάφραση, Εντοπισμός και τα Όρια της 9. Ηθική, Ακεραιότητα και Διαφάνεια: Πολιτική AI στο Newsroom 10. Προστασία πόρων, απόρρητο και ψηφιακή ασφάλεια 11. Ροή εργασιών από άκρο σε άκρο: Το πλήρες ταξίδι μιας είδησης με τροφοδοσία AI
Μονάδα 2 / 11

Ανάλυση Δεδομένων στην Ερευνητική Δημοσιογραφία: Μετατροπή Στοίβων Εγγράφων σε Ειδήσεις

Κέρδη:

  • Δυνατότητα εξερεύνησης ενός συνόλου δεδομένων με τεχνητή νοημοσύνη, δημιουργία ερωτήσεων άξιων ειδήσεων και εξαγωγή ευαίσθητων δεδομένων
  • Αντί να έχετε τεχνητή νοημοσύνη κάντε τους υπολογισμούς, έχοντας τη μέθοδο που περιγράφεται και εκτελείται σε ένα ελεγχόμενο εργαλείο και αποκτώντας τη συνήθεια να επαληθεύετε κάθε εύρημα από ακατέργαστα δεδομένα.
  • Κατανοώντας ότι είναι ευθύνη του δημοσιογράφου να συντάσσει ακραίες τιμές και να τεκμηριώνει τις σχέσεις του αρχείου και να τις επιβεβαιώνει στην αρχική πηγή.

Η ερευνητική δημοσιογραφία ξεκινά συχνά με ένα σωρό: ένα διαγωνιστικό λογιστικό φύλλο χιλιάδων γραμμών, έναν ισολογισμό εκατοντάδων σελίδων, ένα αρχείο email που διέρρευσε, ένα σύνολο δημοσίων δαπανών ανοιχτού κώδικα. Η δημοσιογραφία δεδομένων - η πρακτική της εύρεσης μοτίβων, ανωμαλιών και σχέσεων σε αριθμητικά και τεκμηριωτικά δεδομένα και η μετατροπή τους σε ειδήσεις - είναι ακριβώς η δουλειά της κατανόησης αυτής της μάζας. Σε αυτούς τους σωρούς, που θα χρειαζόταν μια ανθρώπινη ζωή για να τις εξετάσει χειροκίνητα, η τεχνητή νοημοσύνη (AI) είναι ένα ισχυρό εργαλείο πρώτης εξέτασης και δημιουργίας ιδεών: μπορεί να συνοψίσει έναν πίνακα, να εξάγει διπλά ονόματα σε ένα αρχείο κειμένου, να προτείνει ποιες ερωτήσεις πρέπει να ρωτηθούν για ανάλυση, ακόμη και να περιγράψει βήματα καθαρισμού δεδομένων. Αλλά ας βάλουμε μια πρόταση από την αρχή: Η τεχνητή νοημοσύνη είναι συνεργάτης στην ανάλυση δεδομένων. Ο δημοσιογράφος είναι αυτός που αποφασίζει την ακρίβεια και την ειδησεογραφική αξία του αποτελέσματος και επανεξετάζει τον αριθμό από τα πρωτογενή δεδομένα. Ο κίνδυνος παραισθήσεων είναι ο πιο επικίνδυνος εδώ, σε αριθμούς.

Βήμα προς βήμα: εξερεύνηση ενός συνόλου δεδομένων με AI

Βήμα 1 — Γνωρίστε τα δεδομένα. Κατανοήστε πρώτα τις στήλες, τον αριθμό των σειρών, το εύρος ημερομηνιών, τις μονάδες. Μάθετε μόνοι σας τι είναι προτού φορτώσετε το ακατέργαστο αρχείο στο AI. Διαφορετικά, τα «ευρήματα» της AI παραμένουν στον αέρα.

Βήμα 2 — Εξαγωγή ευαίσθητων δεδομένων. Εάν περιέχει προσωπικά δεδομένα (όνομα, TR ID, διεύθυνση, υγεία), ανωνυμοποιήστε τα χωρίς να τα δώσετε στο δημόσιο εργαλείο AI ή στείλτε μόνο τις στήλες που θα αναλυθούν. Τα ίχνη των εγγράφων που διέρρευσαν που αποκαλύπτουν την πηγή καθαρίζονται επίσης (Μονάδες 1 και 10).

Βήμα 3 — Δημιουργήστε ερωτήσεις ανακάλυψης με AI. "Τι νέα θα μπορούσε να κρύβει αυτό το σύνολο δεδομένων;" Ξεκινήστε λέγοντας. Η τεχνητή νοημοσύνη έρχεται με μια λίστα ερωτήσεων που πρέπει να θέσετε: 10 κορυφαία αντικείμενα, επαναλαμβανόμενοι προμηθευτές, ασυνήθιστα άλματα, περιοχές που αφήνονται κενές.

Βήμα 4 — ΜΗΝ ΤΟ AI ΝΑ ΚΑΝΕΙ ΤΗΝ ΑΝΑΛΥΣΗ, ΠΕΡΙΓΡΑΨΤΕ ΤΗΝ. Αυτό είναι το κρίσιμο σημείο. Ο μέσος όρος ή το ποσοστό που υπολογίζει το AI στο κεφάλι είναι συχνά λάθος. Αντίθετα, ζητήστε από το AI για βήματα που θα εκτελέσατε σε ένα αξιόπιστο εργαλείο (τύπος υπολογιστικού φύλλου, ερώτημα, σενάριο). Κάνοντας έτσι τον λογισμό ένα ελεγχόμενο εργαλείο, η τεχνητή νοημοσύνη απλώς δίνει τη μέθοδο.

Βήμα 5 — Επαληθεύστε το εύρημα. Δείτε κάθε ανωμαλία που επισημαίνει το AI επιστρέφοντας στην ακατέργαστη γραμμή. Φιλτράρετε τον πίνακα και μετρήστε τον ισχυρισμό "Αυτή η εταιρεία κέρδισε 31 από 40 διαγωνισμούς". Τυχόν μη επαληθευμένοι αριθμοί δεν θα μεταβούν στις ειδήσεις.

Βήμα 6 — Καθορίστε το πλαίσιο. Ο αριθμός από μόνος του δεν είναι είδηση. Η σύγκριση (πέρυσι, παρόμοιοι θεσμοί, αναλογία πληθυσμού), το πλαίσιο και η γνώμη των ειδικών είναι δουλειά του δημοσιογράφου.

Προσοχή: Το να λέει η τεχνητή νοημοσύνη «υπολογίστε τον μέσο όρο αυτού του πίνακα» και να βάλετε το αποτέλεσμα απευθείας στις ειδήσεις είναι το πιο συνηθισμένο λάθος που προκαλεί αποποίηση ευθύνης της δημοσιογραφίας δεδομένων. Το AI είναι μοντέλο γλώσσας, όχι αριθμομηχανή. Αφήστε το εργαλείο να κάνει τα μαθηματικά, απλώς ρωτήστε το AI για τη μέθοδο και την ερμηνεία.

Ανάλυση μεταδεδομένων και εγγράφων

Εκτός από τους αριθμητικούς πίνακες, η ερευνητική δημοσιογραφία ασχολείται επίσης με μεγάλα αρχεία κειμένων: email, πρακτικά, συμβόλαια. Εδώ, η τεχνητή νοημοσύνη μπορεί να συντάξει χάρτες σχέσεων όπως "ποιος μίλησε με ποιον πότε", "ποιο θέμα επαναλαμβάνεται", "ποια ονόματα αναφέρονται μαζί". Και πάλι, ο κανόνας είναι ο ίδιος: Το AI δίνει έναν αρχικό χάρτη. Κάθε σύνδεσμος επιβεβαιώνεται στο αρχικό έγγραφο, επειδή η τεχνητή νοημοσύνη μπορεί να εξηγήσει πειστικά έναν σύνδεσμο που δεν υπάρχει.

τρεις μίνι θήκες

Περίπτωση 1 — Συγκαλυμμένη συμπύκνωση. Ένας δημοσιογράφος είχε ένα υπολογιστικό φύλλο δημοσίων συμβάσεων με 2.400 σειρές. Έβαλε το AI να παράγει διερευνητικές ερωτήσεις. Το ερώτημα "πόσες προσφορές έλαβε ο ίδιος προμηθευτής;" ήρθε στο προσκήνιο. Ο δημοσιογράφος δεν είχε το AI να το υπολογίσει αυτό. Έτρεξε τον τύπο υπολογιστικού φύλλου που πρότεινε ο ίδιος ο YZ και διαπίστωσε ότι μια μεμονωμένη εταιρεία έλαβε 380 (15,8%) από 2.400 είδη. Το έλεγξε χειροκίνητα και ο αριθμός ήταν σωστός. Η αρχική «εκτίμηση» της τεχνητής νοημοσύνης έλεγε το 22% — οπότε αν το AI ήταν αξιόπιστο, τα νέα θα ήταν λανθασμένα.

Περίπτωση 2 — Εξοικονόμηση χρόνου, αρχείο email. Θα χρειαστούν μέρες για να αναζητήσετε μη αυτόματα "τι θέματα τρέχουν" σε ένα αρχείο 6.000 μηνυμάτων ηλεκτρονικού ταχυδρομείου. Το AI δημιούργησε ένα περίγραμμα θεματικών συμπλεγμάτων σε 15 λεπτά. Από αυτά, ο δημοσιογράφος επέλεξε 3 πολλά υποσχόμενα clusters και διάβασε τα αρχικά μηνύματα ηλεκτρονικού ταχυδρομείου. Ο συνολικός χρόνος ανακάλυψης μειώθηκε σε ~3 ημέρες, αλλά κάθε προσφορά που δημοσιεύτηκε επαληθεύτηκε αυτολεξεί από το αρχικό μήνυμα ηλεκτρονικού ταχυδρομείου.

Περίπτωση 3 — Πιάστηκε ψευδαίσθηση. Ένας οικονομικός δημοσιογράφος έλαβε μια περίληψη από την YZ ότι "οι δαπάνες προσωπικού αυξήθηκαν κατά 60% σε ένα χρόνο" από έναν ισολογισμό. Όταν επέστρεψε στον ακατέργαστο πίνακα, είδε ότι η αύξηση ήταν 6% και ότι το AI είχε διαβάσει λάθος ένα ψηφίο. Ένας μόνο έλεγχος στοιχείων εμπόδισε έναν ψευδή και προσχηματικό τίτλο όπως "έκρηξη 60%.

Αντιγράψιμα πρότυπα

1) Ερωτήσεις αναγνώρισης και ανακάλυψης συνόλων δεδομένων:

Θα σας δώσω τις επικεφαλίδες στηλών και τις πρώτες 20 σειρές ενός συνόλου δεδομένων. Δημιουργήστε 10 δημοσιογραφικές ερωτήσεις που ΜΠΟΡΟΥΝ να γίνουν με αυτά τα δεδομένα: όσον αφορά τη συγκέντρωση, το ακραίο, το άλμα στο χρόνο, τις περιοχές που λείπουν/άδειες, τους επαναλαμβανόμενους ηθοποιούς. Δεν υπάρχει υπολογισμός αριθμών. Απλώς γράψτε ποιες ερωτήσεις αξίζει να κάνετε και γιατί μπορεί να είναι είδηση.Δεδομένα: [επικεφαλίδες + δείγματα γραμμών]

2) Δεν κάνετε υπολογισμούς, αλλά κάνοντας τους να περιγράφουν:

Θέλω να κάνω την εξής ανάλυση: [π.χ. βρείτε το συνολικό ποσό της προσφοράς και το ποσοστό μεριδίου κάθε προμηθευτή]. Θέλω να το εκτελέσω μόνος μου σε υπολογιστικό φύλλο. Γράψτε μου βήμα προς βήμα ποιοι τύποι/ρυθμίσεις περιστροφής να εγκαταστήσω. Αποτέλεσμα υπολογισμού SEN. απλά δώστε τη μέθοδο.Οι στήλες μου: [ονόματα στηλών]

3) Ακριβές κυνήγι:

Θα δώσω συνοπτικά στατιστικά στοιχεία (ελάχιστο, μέγιστο, μέσος όρος, διάμεσος) παρακάτω. Εξηγήστε ποιες τιμές είναι ασυνήθιστες/ύποπτες και γιατί πρέπει να τις ελέγξω για νέα. Μην κάνετε τελικές κρίσεις. Εμφανίζεται μια λίστα ελέγχου με τη μορφή "οι ακόλουθες γραμμές πρέπει να ελεγχθούν χειροκίνητα". Περιλήψεις: [εδώ]

4) Χάρτης σχέσης αρχείου εγγράφων (πρόχειρο):

Θα σας δώσω ένα σύνολο κειμένου εγγράφου. Εξαγάγετε τα ακόλουθα ως ΣΧΕΔΙΟ: ονόματα που εμφανίζονται συχνά μαζί, επαναλαμβανόμενα θέματα, αξιοσημείωτες ημερομηνίες. Επισημάνετε το έγγραφο από το οποίο προέρχεται κάθε σύνδεσμος, όπως [B12]. Μην προσθέτετε σχέσεις που δεν είναι ρητά γραμμένες στο έγγραφο. Τεκμηρίωση: [εδώ]

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμη προτροπή: "Ανάλυσε αυτό το γράφημα και δηλώστε τυχόν σημαντικά ευρήματα."

Αποτέλεσμα: Η τεχνητή νοημοσύνη σχηματίζει ποσοστά και υπολογίζει κατά μέσο όρο, φαντάζεται ανωμαλίες, δεν είναι ξεκάθαρο σε ποια γραμμή βασίζεται. Δεν μπορεί να επαληθευτεί.

Ισχυρή προτροπή: "Δίνω τις στήλες και τις πρώτες 20 σειρές αυτού του πίνακα. (1) Καταχωρίστε τις αναλύσεις που μπορεί να είναι άξιες ειδήσεων. (2) Προτείνετε έναν τύπο υπολογιστικού φύλλου για κάθε ανάλυση, ώστε να μπορώ να την εκτελέσω. (3) Μην υπολογίζετε κανένα αποτέλεσμα. (4) Επισημάνετε τις σειρές που θα ελεγχθούν, όπως [S45]."

Διαφορά: Η ισχυρή προτροπή αφήνει τον υπολογισμό στο ελεγχόμενο εργαλείο, μειώνοντας την τεχνητή νοημοσύνη στον ρόλο της μεθόδου και της κατεύθυνσης. αποτρέπει τη διαρροή παραισθήσεων στον αριθμό.

γράφημα σύγκρισης

Σκηνή

Το AI κάνει

Ο δημοσιογράφος κάνει

επαλήθευση

Αναγνώριση δεδομένων

Περίληψη στήλης/μοτίβου

Γνωρίζει την ενότητα και το πλαίσιο

Λεξικό δεδομένων πηγής

ερωτήσεις ανακάλυψης

Δημιουργεί μια λίστα ερωτήσεων

Επιλέγει την τιμή ειδήσεων

υπολογισμός

Περιγράφει τη μέθοδο

Εκτελεί τον τύπο στο όχημα

Χειροκίνητη παροχή

ακραία

σημειώνει τους υποψηφίους

Κοιτάζει την ακατέργαστη γραμμή

Φιλτράρετε και μετρήστε

Σχόλιο/πλαίσιο

πρόχειρο πλαίσιο

Σύγκριση, ειδικός

δεύτερη πηγή

Συνήθη λάθη

  • Κάνοντας τον υπολογισμό του AI. Έχοντας το AI να υπολογίσει τον μέσο όρο, το ποσοστό, το σύνολο κ.λπ. και να χρησιμοποιήσει το αποτέλεσμα. Η τεχνητή νοημοσύνη κάνει λάθη συχνά, αφήστε το όχημα να κάνει τα μαθηματικά.
  • Μη σύνδεση του ευρήματος με την ακατέργαστη γραμμή. Γράφοντας τον ισχυρισμό «Αυτή η εταιρεία κέρδισε τους περισσότερους διαγωνισμούς» χωρίς φιλτράρισμα του πίνακα και μέτρηση.
  • Δημοσίευση αριθμών χωρίς πλαίσιο. Η αναφορά γυμνών αριθμών χωρίς σύγκριση και αναλογία είναι παραπλανητική.
  • Μεταφόρτωση ευαίσθητων δεδομένων ως έχουν. Δίνοντας προσωπικά δεδομένα ή έγγραφο που αποκαλύπτει την πηγή στο όχημα χωρίς να το καθαρίσετε.
  • Νομίζοντας ότι η ψεύτικη σχέση είναι αληθινή. Επεξεργασία του συνδέσμου που «βλέπει» το AI στο αρχείο στον χάρτη χωρίς να τον επιβεβαιώσετε στο αρχικό έγγραφο.

Συνοπτικά

Στη δημοσιογραφία δεδομένων, η τεχνητή νοημοσύνη είναι ένας συνεργάτης ανακάλυψης και διορατικότητας: σαρώνει το σωρό, δημιουργεί ερωτήσεις για να κάνει, περιγράφει τη μέθοδο ανάλυσης, επισημαίνει υποψηφίους για ακραίες τιμές. Αλλά το να υπολογίσει η τεχνητή νοημοσύνη τον ίδιο τον αριθμό είναι το πιο επικίνδυνο λάθος. Αναθέστε τον υπολογισμό σε ένα ελεγχόμενο εργαλείο, επαληθεύστε κάθε εύρημα επιστρέφοντας στα πρωτογενή δεδομένα και προσθέστε το πλαίσιο και τη σύγκριση στον αριθμό. Στα αρχεία εγγράφων, η τεχνητή νοημοσύνη δίνει έναν αρχικό χάρτη. Κάθε σύνδεσμος επιβεβαιώνεται στο αρχικό έγγραφο.

Εργασία εφαρμογής

Πάρτε ένα σύνολο δεδομένων που έχετε (ή είναι δημόσια διαθέσιμο). Πρώτα, ζητήστε τους να δημιουργήσουν 10 ερωτήσεις με την προτροπή "Ερωτήσεις εξερεύνησης". Επιλέξτε μια ερώτηση, λάβετε τον τύπο από το AI με την προτροπή "Περιγράψτε τον υπολογισμό" και εκτελέστε τον μόνοι σας. Στη συνέχεια, ζητήστε απευθείας από το AI για τον ίδιο υπολογισμό και συγκρίνετε τα δύο αποτελέσματα. Σημειώστε τη διαφορά και το μάθημά της.

λίστα ελέγχου

  • [ ] Κατάλαβα τις στήλες, τις μονάδες και τα ευαίσθητα πεδία πριν δώσω τα δεδομένα στο εργαλείο.
  • [ ] Δεν αφήνω το AI να κάνει τους υπολογισμούς. Περιγράφω τη μέθοδο και την εκτελώ στο εργαλείο ελέγχου.
  • [ ] Επαληθεύω χειροκίνητα κάθε εύρημα επιστρέφοντας στην ακατέργαστη σειρά.
  • [ ] Προσθέτω σύγκριση και πλαίσιο στον αριθμό. Δεν αναφέρω τους απλούς αριθμούς.
  • [ ] Επιβεβαιώνω κάθε σχέση στο αρχείο στο αρχικό έγγραφο.