Створення авторських хабів: ORCID, Crossref та профілі науковців як примітиви довіри
Авторські хаби – це публічні, взаємопов'язані записи, які допомагають людям і машинам відповідати на три основні питання:
- Хто створив цю роботу?
- Що саме представляє собою робота?
- Чому слід довіряти зв'язку між особою, роботою та організацією?
Для людських читачів авторський хаб може виглядати як сторінка профілю з біографією, публікаціями, обліковими даними та посиланнями. Для систем штучного інтелекту корисніше розглядати його як граф пов'язаних доказів.
Надійний авторський хаб пов'язує:
- Особу з ORCID iD
- Публікацію, набір даних, звіт або програмний пакет з Цифровим ідентифікатором об'єкта
- Роботу з повними метаданими Crossref або DataCite
- Дослідника з підтвердженими афіліаціями та організаціями
- Публічний профіль зі стабільною інституційною веб-сторінкою
- Внески з чіткими ролями, такими як ті, що визначені в Таксономії ролей учасників
- Поточні та минулі ролі з датами, джерелами та записами оновлень
Ці зв'язки можуть покращити визначення ідентичності, пошук, точність цитування та верифікацію джерел. Вони не гарантують, що система штучного інтелекту буде цитувати автора. Немає достовірних публічних доказів того, що додавання одного ORCID iD призводить до фіксованого збільшення кількості цитувань штучним інтелектом. Сильніше твердження є вужчим і більш обґрунтованим: хороші метадані про ідентичність і роботу полегшують пошуковим та дослідницьким системам знаходження, зіставлення, верифікацію та коректне цитування наукових матеріалів.
Ця стаття відображає публічну документацію та дослідження, доступні станом на 13 серпня 2026 року.
Чому авторські хаби важливі для систем штучного інтелекту
Не всі системи штучного інтелекту використовують одні й ті самі пошукові індекси, бази даних або методи ранжування. Деякі покладаються на пошук у реальному часі в Інтернеті. Інші використовують наукові бази даних, ліцензовані індекси, внутрішні сховища знань або системи пошуку, які переглядають документи перед генерацією відповіді.
Однак багато систем стикаються з одними й тими ж технічними проблемами:
- Імена можуть писатися по-різному.
- Кілька дослідників можуть мати одне й те саме ім'я.
- Робота може мати препринт, конференційну версію, прийнятий рукопис та остаточну версію.
- Журнальна стаття може бути пов'язана з набором даних, програмним пакетом, грантом або виправленням.
- Автор може змінити установу або ім'я.
- Веб-сторінка може описувати облікові дані, не вказуючи, хто їх видав або коли вони були дійсними.
Постійні ідентифікатори та структуровані метадані допомагають вирішити ці проблеми.
Система цифрових ідентифікаторів об'єктів (Digital Object Identifier system) описує ідентифікатор як постійну назву для цифрового, фізичного або абстрактного об'єкта. Його цінність залежить не лише від ідентифікатора, а й від пов'язаних з ним метаданих. Довідник DOI (doi.org)
Корисний спосіб мислення про авторський хаб – це чотири взаємопов'язані шари:
| Шар | Основне питання | Корисний примітив довіри |
|---|---|---|
| Особа | Хто цей дослідник? | ORCID iD |
| Робота | Яка саме публікація чи результат? | Цифровий ідентифікатор об'єкта |
| Організація | Де відбувалася робота чи роль? | Ідентифікатор реєстру дослідницьких організацій |
| Контекст | Що зробила особа, і хто це підтверджує? | Інституційні та наукові профілі |
Метою є не створення профілю, повного вражаючих слів. Метою є створення запису, в якому можна перевірити важливі твердження.
Три основні частини авторського хабу
1. ORCID: Шар ідентичності особи
ORCID означає Open Researcher and Contributor ID (Відкритий ідентифікатор дослідника та учасника). Він надає постійний ідентифікатор для особи та допомагає розрізняти дослідників, які мають схожі імена, використовують різні форми імен або змінюють свої імена з часом. Огляд ORCID (support.orcid.org)
Запис ORCID може містити:
- Імена та варіанти імен
- Зайнятість та освіту
- Наукові роботи
- Фінансування
- Діяльність з рецензування
- Редакторську діяльність
- Членство та відзнаки
- Дослідницькі ресурси
- Посилання на інші ідентифікатори
Найважливішою особливістю є не саме 16-значне число. Це мережа підтримуваних зв'язків, прикріплених до цього числа.
Наприклад:
text Jane Smith └── ORCID iD ├── Article DOI ├── Dataset DOI ├── Grant identifier ├── University affiliation ├── Software record └── Editorial role
Аутентифіковані зв'язки сильніші
Організації повинні збирати ORCID iD через процес аутентифікованого входу, а не просити людей вводити ідентифікатор у форму. ORCID рекомендує використовувати свій процес авторизації, щоб дослідник підтвердив правильний запис. Керівництво щодо інтеграції та API ORCID (info.orcid.org)
Це розрізнення має значення:
- Непідтверджене твердження: «Цей ORCID iD належить Джейн Сміт.»
- Аутентифіковане твердження: «Джейн Сміт увійшла через ORCID та авторизувала цю систему використовувати її iD.»
- Інституційне твердження: «Університет підтверджує, що ця особа мала цю афіліацію в зазначені дати.»
ORCID також зберігає джерело та походження тверджень. Робота або афіліація може бути додана дослідником, видавцем, спонсором або іншою довіреною організацією. Керівництво ORCID щодо довіри (info.orcid.org)
Це створює корисний сигнал довіри як для людей, так і для машин:
Запис не тільки показує, що стверджується. Він також може показувати, хто зробив твердження і коли воно було додано.
Важливе обмеження
ORCID iD не є гарантією того, що кожен елемент у записі є правильним. Сам ORCID заохочує користувачів вивчати маркери довіри, джерела, дати та організації, які додали інформацію. Маркери довіри ORCID (info.orcid.org)
Тому організації не повинні розглядати «має ORCID iD» як рівнозначне «повністю верифіковано». Краща модель:
- Самостійно заявлено
- Аутентифіковано
- Підтверджено установою
- Підтверджено видавцем
- Підтверджено спонсором
- Нещодавно переглянуто
2. Crossref та DataCite: Шар ідентичності роботи
ORCID ідентифікує особу. Crossref та DataCite допомагають ідентифікувати роботу.
Цифровий ідентифікатор об'єкта може ідентифікувати:
- Журнальні статті
- Книги та розділи книг
- Конференційні матеріали
- Набори даних
- Програмне забезпечення
- Звіти
- Препринти
- Рецензії
- Стандарти
- Постери та презентації
DOI повинен вести на стабільну цільову сторінку. Що ще важливіше, він повинен мати повні метадані, що описують роботу.
Crossref рекомендує записувати таку інформацію, як:
- Прізвище та ім'я
- Ролі учасників
- Афіліації
- Ідентифікатори організації
- ORCID iDs
- Дати публікації
- Анотації
- Посилання
- Фінансування
- Ліцензії
- Інформація про версії
- Оновлення та виправлення
Необхідні та рекомендовані метадані Crossref (crossref.org)
Crossref описує свої метадані як спільний ресурс, до якого можна отримати доступ через веб-інтерфейси, інтерфейси прикладного програмування та масові завантаження. Нижчі системи можуть використовувати цю інформацію для виявлення та зв'язування наукових результатів. Отримання метаданих Crossref (crossref.org)
DataCite виконує схожу функцію для наборів даних та багатьох інших дослідницьких результатів. Його поточна Схема метаданих 4.7, випущена 3 березня 2026 року, підтримує авторів, учасників, ORCID ідентифікатори, афіліації, ідентифікатори організації, пов'язані ідентифікатори, фінансування, описи та типи ресурсів. Схема метаданих DataCite (schema.datacite.org)
DataCite спеціально рекомендує зв'язувати записи авторів та учасників з ідентифікаторами ORCID, а організаційні афіліації – з ідентифікаторами організації. Ідентифікатори імен DataCite (support.datacite.org)
DOI не є знаком якості
DOI доводить, що запис існує в системі реєстрації DOI. Він не доводить, що:
- Дослідження є правильним
- Публікація пройшла рецензування
- Журнал має добру репутацію
- Автор є експертом
- Результати є важливими
Crossref чітко вказує на це: сам DOI не означає цінності або точності об'єкта. Оточуючі метадані надають контекст і дозволяють встановлювати зв'язки. Керівництво Crossref щодо DOI (support.crossref.org)
Саме тому повний запис DOI набагато корисніший, ніж рядок DOI, розміщений у нижній частині сторінки.
Ролі учасників додають сенсу
У липні 2026 року Crossref Schema 5.5 додала кращу підтримку для множинних ролей учасників, авторів для кореспонденції та Таксономії ролей учасників. Crossref Schema 5.5 (crossref.org)
Таксономія ролей учасників містить 14 ролей, зокрема:
- Концептуалізація
- Кураторство даних
- Формальний аналіз
- Дослідження
- Методологія
- Програмне забезпечення
- Керівництво
- Валідація
- Візуалізація
- Написання оригінального чернеткового варіанту
- Написання, рецензування та редагування
Таксономія була розроблена для підвищення прозорості внесків та підтримки визнання, відповідальності, оцінки досліджень та цілісності досліджень. Таксономія ролей учасників (credit.niso.org)
Для систем штучного інтелекту це створює більш насичену відповідь, ніж «Джейн Сміт є автором». Система потенційно може розрізняти:
- Особу, яка розробила дослідження
- Особу, яка написала програмне забезпечення
- Особу, яка проаналізувала дані
- Особу, яка керувала проектом
- Особу, яка написала оригінальний рукопис
Це особливо важливо для великих дослідницьких команд та технічних проектів.
3. Профілі науковців: Шар контексту
Профілі науковців роблять граф ідентичності зрозумілим для людей та легшим для інтерпретації пошуковими системами.
Надійний профіль повинен включати:
- Стабільну інституційну сторінку
- Послідовне ім'я
- Варіанти імені, де це доречно
- ORCID iD
- Поточні та минулі афіліації
- Напрямки досліджень
- Вибрані роботи з посиланнями на DOI
- Набори даних, програмне забезпечення та звіти
- Фінансування та нагороди
- Редакторські або рецензійні ролі
- Ролі учасників
- Дати для поточних та минулих посад
- Дату останнього перегляду
- Посилання на інші публічні профілі
Профілі Google Scholar дозволяють дослідникам публікувати список публікацій, робити профіль публічним, бачити, хто цитує їхні роботи, та відстежувати метрики цитування. Публічний профіль з підтвердженою інституційною адресою електронної пошти може бути кваліфікований для появи в результатах пошуку Google Scholar. Профілі Google Scholar (scholar.google.com)
Однак Google Scholar слід розглядати як шар видимості та відкриття, а не основне джерело істини. Дослідники можуть керувати власними списками публікацій, а автоматичне зіставлення може включати неправильні або дубльовані роботи. Кількість цитувань також відрізняється в різних базах даних.
OpenAlex пропонує ще один корисний шар відкриття. Він підтримує розрізнені записи авторів та пов'язує авторів, роботи, установи, джерела та теми. OpenAlex стверджує, що черпає інформацію з таких джерел, як Crossref та DataCite, а потім зіставляє авторів з ORCID iD та афіліації з ідентифікаторами організації. Опис екосистеми OpenAlex (help.openalex.org)
Тому найкращою практикою є федерація профілів:
text Інституційна сторінка автора ↕ Запис ORCID ↕ Записи робіт Crossref або DataCite ↕ Профілі OpenAlex та Google Scholar ↕ Сторінки видавців, репозиторіїв, спонсорів та професійні сторінки
Жоден окремий профіль не повинен містити все. Вони повинні посилатися один на одного та використовувати одні й ті самі ідентифікатори.
Як ці сигнали можуть впливати на цитування штучним інтелектом
Важливо розрізняти п'ять різних подій:
- Виявлення: Чи може система знайти сторінку або роботу?
- Визначення ідентичності: Чи може вона визначити, яка особа та організація залучені?
- Отримання: Чи система включає роботу до свого набору доказів?
- Вибір цитування: Чи вона цитує роботу у відповіді?
- Коректність цитування: Чи посилається цитата на правильну роботу та підтримує твердження?
ORCID, метадані DOI та профілі науковців можуть найбезпосередніше допомогти з першими трьома кроками. Вони також можуть покращити коректність цитування. Їх вплив на вибір цитування, ймовірно, залежатиме від актуальності теми, якості джерела, давності, доступності та конкретної системи штучного інтелекту.
Документація Google Search рекомендує використовувати сторінку автора, url та посилання sameAs для допомоги у визначенні авторів статей. Для наборів даних Google спеціально рекомендує використовувати ORCID iD у властивості sameAs для особи-автора. Структуровані дані статті Google Структуровані дані набору даних Google (developers.google.com)
Проста сторінка профілю могла б використовувати структуровані дані, як це:
{ "@context": "https://schema.org", "@type": "Person", "@id": "https://institution.edu/people/jane-doe#person", "name": "Jane Doe", "url": "https://institution.edu/people/jane-doe", "sameAs": [ "https://orcid.org/0000-0000-0000-0000", "https://scholar.google.com/citations?user=EXAMPLE", "https://openalex.org/authors/A0000000000" ], "affiliation": { "@type": "Organization", "name": "Example University", "sameAs": "https://ror.org/000000000" }, "subjectOf": [ { "@type": "ScholarlyArticle", "identifier": "https://doi.org/10.0000/example" } ] }
Структуровані дані не гарантують функцію пошуку або цитування штучним інтелектом. Google стверджує, що навіть правильно реалізовані структуровані дані можуть не з'являтися в результатах пошуку. Їхня цінність полягає в тому, що вони надають машинам чіткий, стандартний спосіб інтерпретації сторінки. Керівництво Google щодо структурованих даних (developers.google.com)
Практичний висновок такий:
Ідентифікатори покращують шлях до доказів. Вони не замінюють доказів.
Що говорять поточні дослідження про цитування штучним інтелектом
Дослідження поведінки цитування штучним інтелектом переважно вивчали точність цитування, вибір джерел та можливість верифікації. Вони ще не дали надійної, загальної оцінки впливу сили ідентичності, пов'язаної з ORCID.
Дослідження цитувань, згенерованих ChatGPT у 2023 році, виявило значну кількість сфабрикованих посилань та помилок у реальних посиланнях. Дослідження проаналізувало 636 цитувань, згенерованих у 84 статтях, і виявило, що проблеми з цитуванням залишалися навіть у протестованій новій моделі. Дослідження Scientific Reports (nature.com)
Інше дослідження генеративних пошукових систем виявило, що багато згенерованих речень не були повністю підтверджені цитуваннями, і що багато цитувань недостатньо підтримували твердження поруч з ними. Оцінка верифікованості в генеративних пошукових системах (arxiv.org)
Недавні дослідження також показують, що генеративні пошукові системи відрізняються у виборі джерел, їх перекритті, стабільності та використанні внутрішніх проти зовнішніх знань. Характеристика веб-пошуку в епоху генеративного штучного інтелекту (aclanthology.org)
Ці висновки підтримують обережну позицію:
- DOI може зменшити двозначність щодо цитованої роботи.
- ORCID може зменшити двозначність щодо особи.
- Ідентифікатори афіліації можуть зменшити двозначність щодо організації.
- Ролі учасників можуть покращити атрибуцію.
- Публічний профіль може надати контекст.
- Жоден з цих сигналів не гарантує, що система отримає або процитує роботу.
Програма досліджень для вимірювання сили ідентичності та частоти цитувань штучним інтелектом
Організації не повинні стверджувати, що авторські хаби покращують цитування штучним інтелектом, доки вони не виміряють цей зв'язок безпосередньо.
Визначити показник сили ідентичності автора
Нижче наведено запропонований показник, а не офіційний стандарт.
| Компонент | Запропоновані бали | Вимірювання |
|---|---|---|
| Аутентифікований ORCID iD | 15 | Дослідник підтвердив iD через авторизацію ORCID |
| Зв'язки ORCID-робота | 15 | Роботи в записі ORCID відповідають записам DOI |
| Якість джерела ORCID | 10 | Важливі твердження походять від видавців, спонсорів або установ |
| Повнота DOI | 15 | Запис DOI включає авторів, ORCID, афіліації, дати, анотацію та посилання, де це доречно |
| Зв'язок з організацією | 10 | Афіліація включає постійний ідентифікатор організації |
| Ролі учасників | 10 | Записи робіт включають чіткі ролі внесків |
| Інституційний профіль | 10 | Існує стабільна, публічна, актуальна сторінка автора |
| Федерація профілів науковців | 5 | Записи Google Scholar та OpenAlex посилаються на ту саму особу |
| Актуальність | 10 | Запис та профіль були переглянуті протягом останнього року |
| Всього | 100 |
Не включайте кількість цитувань, престиж журналу або рейтинг установи до цього показника. Ці фактори слід розглядати як окремі змінні. Їх включення ускладнило б визначення того, чи пов'язана сама сила ідентичності з частотою цитувань.
Вимірювати більше ніж один вид цитування
Корисне дослідження повинно відстежувати щонайменше шість результатів:
-
Показник цитування робіт Відсоток відповідних відповідей, що цитують конкретну роботу.
-
Показник атрибуції автора Відсоток відповідей, що правильно називають або приписують роботу потрібному автору.
-
Показник дійсних ідентифікаторів Відсоток цитувань, що містять DOI, який веде до правильної роботи.
-
Точність цитування Відсоток цитувань, які фактично підтримують зроблене твердження.
-
Повнота цитування Відсоток важливих допоміжних джерел, які цитує система.
-
Міжплатформна стабільність Відсоток цитувань, що повторюються в різних системах або повторних запусках.
Нещодавня рамка вимірювання для генеративного пошуку розділяє вибір цитування від поглинання цитування, тобто чи з'являється джерело лише в списку цитувань, чи фактично надає докази для відповіді. Це розрізнення слід включити до майбутніх досліджень авторських хабів. Рамка вибору цитування та поглинання цитування (arxiv.org)
Дослідження перше: Обсерваційне кореляційне дослідження
Це дослідження запитує:
Чи роботи, пов'язані з сильнішими авторськими ідентичностями, частіше цитуються системами штучного інтелекту після контролю за тематичними та публікаційними факторами?
Запропонований дизайн
- Вибірка від 10 000 до 50 000 наукових робіт
- Охоплення кількох дисциплін, мов та типів публікацій
- Використання даних Crossref, DataCite, OpenAlex та публічних даних ORCID
- Розрахунок показника сили ідентичності для кожного автора та роботи
- Створення набору питань, для яких вибрані роботи є релевантними
- Запуск питань через кілька систем, що генерують цитування
- Повторення кожного питання кілька разів
- Запис дати, системи, налаштувань моделі, регіону та цитованих джерел
Важливі контрольні змінні
Дослідження повинно контролювати:
- Актуальність теми
- Рік публікації
- Статус відкритого доступу
- Наявність анотації
- Наявність повного тексту
- Місце публікації
- Існуюча кількість наукових цитувань
- Інституційна репутація
- Мова
- Швидкість сторінки та доступність для краулерів
- Тип роботи
- Поширеність імені автора
- Кількість співавторів
- Формулювання запиту
- Пошукова система
Основна статистична модель могла б оцінити:
text Ймовірність правильного цитування = сила ідентичності
- тематична релевантність
- вік роботи
- відкритий доступ
- наукові цитування
- система
- запит
- авторські та тематичні контролі
Логістична регресія або моделі зі змішаними ефектами були б доречними для результату «так» чи «ні», наприклад, чи була робота процитована. Негативна біноміальна модель може бути корисною для підрахунку цитувань, оскільки дані цитувань часто розподіляються нерівномірно.
Результат слід повідомляти як відношення шансів з довірчим інтервалом, а не як простий відсоток. Наприклад:
Збільшення сили ідентичності на одне стандартне відхилення було пов'язано зі зміною ймовірності цитування після контролю за релевантністю, віком, доступом та попередньою науковою увагою.
Дослідження також повинно повідомляти про нульові результати. Виявлення відсутності зв'язку було б корисним, оскільки це показало б, що ідентифікатори покращують якість даних без обов'язкової зміни поведінки цитування штучним інтелектом.
Дослідження друге: Контрольований експеримент з метаданими
Обсерваційне дослідження може плутати силу ідентичності з популярністю. Контрольований експеримент може ізолювати деякі ефекти.
Існують дві практичні версії.
Версія А: Експеримент у публічному Інтернеті
Створити зіставлені сторінки з однаковим змістовним наповненням, але різними обробками метаданих:
- Лише базове ім'я автора
- Ім'я автора плюс інституційний профіль
- Ім'я автора плюс посилання на ORCID
- Ім'я автора, ORCID, DOI, ідентифікатор афіліації та структуровані дані
Опублікувати сторінки одночасно та відстежувати:
- Виявлення пошуком
- Правильне зіставлення автора
- Отримання в відповідях штучного інтелекту
- Частота цитування
- Коректність цитування
Цей експеримент необхідно інтерпретувати обережно. Публічні системи можуть сканувати сторінки в різний час, і організації не можуть легко змінювати записи Crossref або DataCite для вже опублікованої роботи.
Версія В: Контрольований дослідницький індекс
Створити невелику систему пошуку, що містить ті самі документи за різних умов метаданих. Варіювати лише:
- Ідентифікатор автора
- DOI
- Афіліація
- Роль учасника
- Посилання на профіль
- Поля походження
Потім поставити ті самі питання та виміряти отримання та вибір цитування. Цей експеримент надає кращий контроль, але він вимірює дослідницьку систему, а не комерційні платформи.
Дослідження третє: Поетапне впровадження в організації
Найсильнішим практичним дизайном є дослідження різниці в різницях.
Організація може впроваджувати авторські хаби поетапно:
- Відділ перший отримує повну програму в жовтні 2026 року.
- Відділ другий отримує її в січні 2027 року.
- Відділ третій отримує її в квітні 2027 року.
Всі відділи вимірюються до та після впровадження. Відділи, які ще не отримали програму, служать тимчасовими порівняльними групами.
Виміряти:
- Показник правильної атрибуції автора
- Розділення DOI
- Частота цитування
- Точність цитування
- Пошукові покази
- Відвідування сторінок профілю
- Час, необхідний для виправлення неправильних метаданих
Цей дизайн є сильнішим, ніж просте порівняння «до-після», оскільки він допомагає відокремити ефект впровадження від ширших змін у системах штучного інтелекту.
Гіпотези, які варто перевірити
Організації можуть попередньо зареєструвати ці гіпотези:
- H1: Сильніші зв'язки ідентичності покращують правильну атрибуцію автора.
- H2: Повні метадані DOI покращують показники дійсних цитувань.
- H3: Ідентифікатори афіліації допомагають найбільше, коли автори мають поширені імена або переміщуються між установами.
- H4: Профілі науковців покращують виявлення більше, ніж покращують остаточну частоту цитувань.
- H5: Сила ідентичності має більший вплив на маловідомих авторів, ніж на вже відомих авторів.
- H6: Ефект варіюється залежно від системи, теми, мови та типу публікації.
- H7: Актуальність та тематична релевантність мають більше значення, ніж прикрашання профілю.
Які облікові дані слід публікувати?
Профіль повинен публікувати облікові дані, які можна перевірити. Кожні облікові дані повинні мати:
- Тип облікових даних
- Особу, яка їх має
- Організацію, що видала
- Постійний ідентифікатор організації, якщо доступний
- Дати початку та закінчення
- Джерело перевірки
- Статус, наприклад: поточний, прострочений, оскаржений або архівний
- Дату останнього перегляду
| Облікові дані | Публіковані докази |
|---|---|
| Працевлаштування | Установа, ідентифікатор організації, відділ, дата початку, дата закінчення |
| Освіта | Ступінь, установа, що присудила, рік закінчення, джерело перевірки |
| Грант | Спонсор, номер нагороди, роль, дати, сторінка проекту |
| Публікація | DOI, автори, афіліації, ролі учасників |
| Набір даних | DataCite DOI, автор, ліцензія, версія, репозиторій |
| Програмне забезпечення | Репозиторій, випуск, DOI, ліцензія, роль |
| Редакторська діяльність | Журнал, роль, дата початку, дата закінчення |
| Рецензування | Публічний запис рецензії або перевірений запис послуги, де дозволено |
| Нагорода | Орган, що присудив, назва нагороди, рік, публічне оголошення |
| Сертифікація | Видавець, номер облікових даних, дата видачі, дата закінчення терміну дії |
Організації повинні позначати джерело кожних облікових даних:
- Самостійно повідомлено
- Інституційно верифіковано
- Верифіковано видавцем
- Верифіковано спонсором
- Імпортовано з реєстру
- Очікує перегляду
Уникайте публікації непідтверджених етикеток, таких як «провідний експерт» або «всесвітньо відомий дослідник». Замініть їх доказами:
- Кількість та тип робіт
- Напрямки досліджень
- Підтверджені ролі
- Фінансовані проекти
- Редакторська діяльність
- Публічні набори даних або програмне забезпечення
- Інституційні призначення
Такий підхід є більш корисним як для читачів, так і для машин.
План впровадження для організацій
Етап перший: Створити політику метаданих
Призначити невелику керівну групу з представниками від:
- Наукової адміністрації
- Бібліотечних служб
- Інформаційних технологій
- Комунікацій
- Видавничих або репозитарних послуг
- Приватності
- Доброчесності досліджень
Створити коротку політику даних, яка визначає:
- Обов'язкові поля
- Затверджені системи ідентифікаторів
- Хто може стверджувати кожне поле
- Які поля є публічними
- Як обробляються виправлення
- Скільки часу повинні займати оновлення
- Що відбувається, коли людина звільняється
Використовуйте єдиний договір про дані для всіх систем. Як мінімум, кожен запис про особу, роботу, організацію та облікові дані повинен мати:
text persistent_id display_name source asserted_by valid_from valid_to last_verified status evidence_url
Етап другий: Зібрати аутентифіковані ідентифікатори
Попросіть дослідників підключити свої записи ORCID через аутентифікований процес. Не покладайте на установу відповідальність за вгадування, який ORCID iD належить людині.
Водночас:
- Призначити ідентифікатори організації відділам та установам
- Пов'язати записи персоналу з ORCID
- Зіставити існуючі публікації з записами DOI
- Виявити колізії імен
- Зберегти альтернативні форми імен
- Записати налаштування згоди та видимості
Етап третій: Покращити метадані DOI
Для нових робіт вимагайте, щоб робочий процес публікації збирав:
- Повні імена авторів
- Аутентифіковані ORCID iDs
- Афіліації
- Ідентифікатори організації
- Ролі учасників
- Ідентифікатори фінансування
- Анотації
- Посилання
- Ліцензії
- Інформацію про версію та оновлення
Для старих робіт почніть з останніх п'яти років та найактивніших авторів організації.
Crossref та DataCite повинні отримувати виправлення та оновлення, а не лише початковий депозит. Рядки DOI залишаються постійними, тоді як пов'язані метадані можуть підтримуватися. Обслуговування метаданих Crossref (crossref.org)
Етап четвертий: Створити канонічні сторінки авторів
Кожен дослідник повинен мати одну стабільну інституційну сторінку. Ця сторінка повинна:
- Використовувати постійну веб-адресу
- Показувати поточну роль
- Зберігати попередні ролі з датами
- Посилатися на ORCID
- Посилатися на вибрані записи DOI
- Посилатися на публічні профілі науковців
- Показувати напрямки досліджень
- Відображати дату останнього оновлення
- Використовувати структуровані дані
- Залишатися доступною для пошукових краулерів
- Уникати вимоги входу
Google рекомендує використовувати чіткі URL-адреси авторів та посилання sameAs для допомоги у розрізненні авторів. Керівництво Google щодо розмітки автора (developers.google.com)
Етап п'ятий: Об'єднати та моніторити профілі
Пов'язати інституційну сторінку з:
- ORCID
- Google Scholar
- OpenAlex
- Сторінками видавців
- Записами репозиторіїв
- Сторінками грантів
- Публічними професійними профілями, де це доречно
Використовувати автоматизовані перевірки для виявлення:
- Поламаних посилань DOI
- Відсутніх посилань ORCID
- Дубльованих авторів
- Неправильних зіставлень співавторів
- Старих афіліацій
- Прострочених облікових даних
- Відсутніх дат оновлення
- Незбіжних імен
- Відкликань або виправлень
Управління оновленнями та змінами ролей
Авторський хаб повинен зберігати історію. Він не повинен переписувати минуле щоразу, коли людина змінює роботу.
Рекомендована ієрархія джерел
| Інформація | Основний орган влади |
|---|---|
| Контрольоване особою ім'я та публічна видимість | Дослідник та ORCID |
| Поточне працевлаштування | Установа |
| Авторство публікації | Видавець та реєстр DOI |
| Роль учасника | Видавець, запис проекту або офіційне виправлення |
| Присудження гранту | Спонсор |
| Ступінь або сертифікація | Організація, що видала |
| Презентація публічного профілю | Установа, з переглядом дослідника |
Коли дослідник змінює установу
Не видаляйте стару афіліацію з історичних робіт.
Натомість:
- Додайте кінцеву дату до попереднього запису про працевлаштування.
- Додайте нову афіліацію з датою початку.
- Оновіть інституційний профіль.
- Зберігайте історичні афіліації публікацій незмінними, якщо видавець не видасть виправлення.
- Оновіть запис ORCID через відповідне джерело.
- Перенаправте стару сторінку профілю на архівну або нову сторінку.
Коли людина змінює ім'я
Використовуйте ORCID для зв'язування варіантів імен. Додавайте попередні або альтернативні імена там, де дослідник погоджується. Не змінюйте ім'я автора в опублікованому записі DOI лише для того, щоб воно відповідало поточному профілю.
Метою постійного ідентифікатора є зв'язування робіт через зміни імен без переписування запису публікації.
Коли роль учасника змінюється
Роль учасника у завершеній роботі слід розглядати як частину історичного запису.
Наприклад:
- Роль особи в опублікованій статті не повинна змінюватися через те, що вона пізніше стає завідувачем кафедри.
- Редакторська роль повинна мати дату початку та закінчення.
- Роль у гранті повинна бути прив'язана до періоду гранту.
- Роль у програмному забезпеченні повинна бути прив'язана до версії або випуску.
Якщо оригінальний запис внеску неправильний, використовуйте офіційний процес виправлення. Не перезаписуйте його мовчки.
Коли термін дії облікових даних закінчується
Використовуйте чіткі значення статусу:
- Поточний
- Прострочений
- Поновлений
- Призупинений
- Оскаржений
- Архівний
Автоматичні нагадування повинні надсилатися до закінчення терміну дії. Публічні профілі повинні показувати статус та дату, а не залишати застарілі облікові дані видимими без пояснення.
Коли дослідник залишає організацію
Організація повинна:
- Зберігати історичний профіль
- Чітко позначати колишню роль
- Зберігати посилання на опубліковані роботи
- Передавати право власності на профіль
- Встановити перенаправлення для колишньої сторінки
- Видалити приватну контактну інформацію
- Зберігати інституційні твердження, які були правдивими під час попереднього працевлаштування
Коли авторство оскаржується
Заморозити оскаржуване поле, зберегти оригінальне джерело та зареєструвати спір. Не видаляйте автора та не змінюйте ролі внесків лише на підставі неофіційного запиту.
Офіс з доброчесності досліджень, видавець або відповідальний орган проекту повинні визначити офіційний шлях виправлення.
Показники успіху
Організації повинні відстежувати операційну якість, перш ніж обіцяти підвищену видимість штучного інтелекту.
Пропоновані цілі включають:
- 95 відсотків активних дослідників мають аутентифіковані ORCID iDs
- 95 відсотків нових робіт включають ORCID, де доступно
- 95 відсотків афіліацій використовують постійний ідентифікатор організації
- 100 відсотків нових депозитів DOI проходять валідацію метаданих
- 100 відсотків сторінок авторів містять стабільну адресу профілю
- 100 відсотків змін ролей включають дати
- Менше 1 відсотка робіт неправильно призначено автору
- Виправлення метаданих завершуються протягом 30 днів
- Зміни поточного працевлаштування з'являються протягом семи днів
- Відкликання та офіційні виправлення відображаються оперативно
Для дослідження цитувань штучним інтелектом відстежуйте:
- Показник правильної атрибуції автора
- Показник дійсних DOI
- Точність цитування
- Повнота цитування
- Частота цитування робіт
- Міжсистемна згода
- Час від виправлення метаданих до покращеного індексування
- Відмінність між виявленням профілю та кінцевим цитуванням відповіді
Організація повинна повідомляти ці показники за дисципліною, мовою, етапом кар'єри та поширеністю імені. В іншому випадку середній показник може приховувати нерівні результати.
Ризики та запобіжні заходи
Авторські хаби можуть створювати нові ризики, якщо вони стануть системою контролю доступу.
Організації не повинні:
- Карати дослідників, які зберігають деяку інформацію ORCID приватною
- Розглядати публічний профіль Google Scholar як доказ якості
- Використовувати кількість цитувань як заміну рецензуванню
- Публікувати особисті контактні дані без необхідності
- Виводити експертизу лише з інституційного престижу
- Вимагати від кожного дослідника використання одного й того ж сервісу публічного профілю
- Розглядати відсутність ідентифікаторів як доказ неправомірної поведінки
- Дозволяти автоматизованим системам перезаписувати записи без перегляду
Прийняття ORCID та якість метаданих варіюються за галуззю, країною, етапом кар'єри та типом публікації. Справедлива система повинна підтримувати ручні виправлення, контроль конфіденційності, різноманітність імен та людей, чия робота недостатньо представлена метриками журнальних публікацій.
Висновок
Сильний авторський хаб – це не проект особистого брендингу. Це машинозчитувана система доказів.
- ORCID пов'язує особу з постійною ідентичністю.
- Crossref та DataCite пов'язують роботи зі стабільними ідентифікаторами та насиченими метаданими.
- Ідентифікатори реєстру дослідницьких організацій пов'язують людей та роботи з установами.
- Ролі учасників показують, що саме зробила кожна особа.
- Інституційні та наукові профілі надають публічний контекст.
- Структуровані дані допомагають пошуковим системам інтерпретувати зв'язки.
- Управління та історія версій показують, що є актуальним, що було правдою в минулому, і хто підтвердив кожне твердження.
Ймовірна вигода – це не автоматичне підвищення рейтингу. Вигода полягає в сильнішому ланцюжку від особи → роботи → організації → доказів.
Тому організації повинні взяти на себе два зобов'язання:
- Стандартизувати та підтримувати метадані.
- Вимірювати поведінку цитування штучним інтелектом, а не припускати ефект.
Найбільш достовірний авторський хаб – це не той, що має найбільше значків. Це той, чиї важливі твердження є постійними, пов'язаними, підтвердженими джерелами, актуальними та легко верифікованими.
Auto