AutoPodAutoPod

Xây dựng Trung tâm Tác giả: ORCID, Crossref và Hồ sơ Học giả như các Yếu tố Tin cậy Cơ bản

39 phút đọc
Bài viết âm thanh
Xây dựng Trung tâm Tác giả: ORCID, Crossref và Hồ sơ Học giả như các Yếu tố Tin cậy Cơ bản
0:000:00
Xây dựng Trung tâm Tác giả: ORCID, Crossref và Hồ sơ Học giả như các Yếu tố Tin cậy Cơ bản

Xây dựng Trung tâm Tác giả: ORCID, Crossref và Hồ sơ Học giả như các Yếu tố Tin cậy Cơ bản

Trung tâm tác giả là các hồ sơ công khai, được kết nối, giúp con người và máy móc trả lời ba câu hỏi cơ bản:

  1. Ai đã tạo ra công trình này?
  2. Công trình này chính xác là gì?
  3. Tại sao người ta nên tin tưởng mối liên hệ giữa người, công trình và tổ chức?

Đối với người đọc, một trung tâm tác giả có thể trông giống như một trang hồ sơ với tiểu sử, ấn phẩm, bằng cấp và các liên kết. Đối với hệ thống trí tuệ nhân tạo, hữu ích hơn khi coi đó là một đồ thị bằng chứng liên kết.

Một trung tâm tác giả mạnh mẽ kết nối:

  • Một người với ORCID iD
  • Một ấn phẩm, tập dữ liệu, báo cáo hoặc gói phần mềm với một Mã định danh đối tượng số (DOI)
  • Một công trình với siêu dữ liệu Crossref hoặc DataCite hoàn chỉnh
  • Một nhà nghiên cứu với các liên kết và tổ chức đã được xác minh
  • Một hồ sơ công khai với một trang web tổ chức ổn định
  • Các đóng góp với vai trò rõ ràng, chẳng hạn như những vai trò trong Phân loại Vai trò Người đóng góp (Contributor Roles Taxonomy)
  • Các vai trò hiện tại và quá khứ với ngày tháng, nguồn và hồ sơ cập nhật

Những kết nối này có thể cải thiện xác định danh tính, truy xuất, độ chính xác của trích dẫn và xác minh nguồn gốc. Chúng không đảm bảo rằng một hệ thống trí tuệ nhân tạo sẽ trích dẫn một tác giả. Không có bằng chứng công khai đáng tin cậy nào cho thấy việc thêm một ORCID iD sẽ tạo ra một sự gia tăng cố định trong các trích dẫn trí tuệ nhân tạo. Khẳng định mạnh mẽ hơn thì hẹp hơn và có thể bảo vệ được hơn: siêu dữ liệu danh tính và công trình tốt giúp các hệ thống tìm kiếm và nghiên cứu dễ dàng tìm thấy, đối sánh, xác minh và trích dẫn chính xác tài liệu học thuật.

Bài viết này phản ánh các tài liệu và nghiên cứu công khai có sẵn tính đến ngày 13 tháng 8 năm 2026.

Tại sao Trung tâm Tác giả lại quan trọng đối với Hệ thống Trí tuệ nhân tạo

Các hệ thống trí tuệ nhân tạo không phải tất cả đều sử dụng cùng một chỉ mục tìm kiếm, cơ sở dữ liệu hoặc phương pháp xếp hạng. Một số dựa vào tìm kiếm web trực tiếp. Số khác sử dụng cơ sở dữ liệu học thuật, chỉ mục được cấp phép, kho kiến thức nội bộ hoặc hệ thống truy xuất tìm kiếm tài liệu trước khi tạo ra câu trả lời.

Tuy nhiên, nhiều hệ thống đối mặt với cùng các vấn đề kỹ thuật:

  • Tên có thể được viết theo nhiều cách khác nhau.
  • Một số nhà nghiên cứu có thể có cùng tên.
  • Một công trình có thể có bản in trước, phiên bản hội nghị, bản thảo được chấp nhận và phiên bản cuối cùng.
  • Một bài báo tạp chí có thể được liên kết với một tập dữ liệu, gói phần mềm, tài trợ hoặc bản chỉnh sửa.
  • Một tác giả có thể thay đổi tổ chức hoặc tên.
  • Một trang web có thể mô tả một bằng cấp mà không cho thấy ai đã cấp nó hoặc khi nào nó có giá trị.

Các mã định danh bền vững và siêu dữ liệu có cấu trúc giúp giải quyết những vấn đề này.

Hệ thống Mã định danh đối tượng số (DOI) mô tả một mã định danh là một tên bền vững cho một đối tượng số, vật lý hoặc trừu tượng. Giá trị của nó không chỉ phụ thuộc vào mã định danh, mà còn vào siêu dữ liệu được kết nối với nó. Sổ tay DOI (doi.org)

Một cách hữu ích để nghĩ về trung tâm tác giả là coi nó như bốn lớp kết nối:

LớpCâu hỏi chínhYếu tố tin cậy hữu ích
NgườiNhà nghiên cứu này là ai?ORCID iD
Công trìnhẤn phẩm hoặc sản phẩm chính xác là gì?Mã định danh đối tượng số
Tổ chứcCông trình hoặc vai trò này diễn ra ở đâu?Mã định danh Đăng ký Tổ chức Nghiên cứu
Ngữ cảnhNgười này đã làm gì, và ai xác nhận điều đó?Hồ sơ tổ chức và hồ sơ học giả

Mục tiêu không phải là tạo ra một hồ sơ đầy những từ ngữ ấn tượng. Mục tiêu là tạo ra một hồ sơ mà trong đó các tuyên bố quan trọng có thể được kiểm tra.

Ba Phần Chính của Trung tâm Tác giả

1. ORCID: Lớp Định danh Cá nhân

ORCID là viết tắt của Mã định danh Nhà nghiên cứu và Người đóng góp Mở (Open Researcher and Contributor ID). Nó cung cấp một mã định danh bền vững cho một người và giúp phân biệt các nhà nghiên cứu có tên tương tự, sử dụng các dạng tên khác nhau hoặc thay đổi tên theo thời gian. Tổng quan về ORCID (support.orcid.org)

Một hồ sơ ORCID có thể chứa:

  • Tên và các biến thể tên
  • Việc làm và học vấn
  • Các công trình nghiên cứu
  • Tài trợ
  • Hoạt động bình duyệt
  • Dịch vụ biên tập
  • Tư cách thành viên và các danh hiệu
  • Tài nguyên nghiên cứu
  • Liên kết đến các mã định danh khác

Tính năng quan trọng nhất không phải là chính số 16 chữ số đó. Đó là mạng lưới các kết nối được hỗ trợ gắn liền với số đó.

Ví dụ:

text Jane Smith └── ORCID iD ├── Article DOI ├── Dataset DOI ├── Grant identifier ├── University affiliation ├── Software record └── Editorial role

Các kết nối được xác thực mạnh mẽ hơn

Các tổ chức nên thu thập ORCID iD thông qua quy trình đăng nhập được xác thực thay vì yêu cầu mọi người nhập mã định danh vào một biểu mẫu. ORCID khuyến nghị sử dụng quy trình ủy quyền của mình để nhà nghiên cứu xác nhận hồ sơ chính xác. Hướng dẫn tích hợp và giao diện lập trình ứng dụng ORCID (info.orcid.org)

Sự phân biệt này rất quan trọng:

  • Tuyên bố chưa được xác minh: “ORCID iD này thuộc về Jane Smith.”
  • Tuyên bố đã được xác thực: “Jane Smith đã đăng nhập qua ORCID và ủy quyền cho hệ thống này sử dụng iD của cô ấy.”
  • Khẳng định của tổ chức: “Trường đại học xác nhận rằng người này đã có liên kết này trong các khoảng thời gian này.”

ORCID cũng lưu trữ nguồn và gốc của các khẳng định. Một công trình hoặc liên kết có thể được thêm bởi nhà nghiên cứu, nhà xuất bản, nhà tài trợ hoặc một tổ chức đáng tin cậy khác. Hướng dẫn tin cậy ORCID (info.orcid.org)

Điều này tạo ra một tín hiệu tin cậy hữu ích cho cả con người và máy móc:

Hồ sơ không chỉ cho biết những gì được tuyên bố. Nó còn có thể cho thấy ai đã đưa ra tuyên bố đó và khi nào nó được thêm vào.

Hạn chế quan trọng

Một ORCID iD không phải là sự đảm bảo rằng mọi mục trong hồ sơ đều chính xác. Bản thân ORCID khuyến khích người dùng kiểm tra các dấu hiệu tin cậy, nguồn, ngày tháng và các tổ chức đã thêm thông tin. Dấu hiệu tin cậy ORCID (info.orcid.org)

Do đó, các tổ chức không nên coi “có ORCID iD” là tương đương với “đã được xác minh đầy đủ.” Một mô hình tốt hơn là:

  • Tự khẳng định
  • Đã xác thực
  • Được tổ chức xác nhận
  • Được nhà xuất bản xác nhận
  • Được nhà tài trợ xác nhận
  • Mới được xem xét

2. Crossref và DataCite: Lớp Định danh Công trình

ORCID xác định cá nhân. Crossref và DataCite giúp xác định công trình.

Mã định danh đối tượng số có thể xác định:

  • Bài báo tạp chí
  • Sách và chương sách
  • Kỷ yếu hội nghị
  • Tập dữ liệu
  • Phần mềm
  • Báo cáo
  • Bản in trước
  • Bình duyệt
  • Tiêu chuẩn
  • Áp phích và bài thuyết trình

Một DOI phải dẫn đến một trang đích ổn định. Quan trọng hơn, nó phải có siêu dữ liệu hoàn chỉnh mô tả công trình.

Crossref khuyến nghị ghi lại thông tin như:

  • Họ và tên đệm
  • Vai trò người đóng góp
  • Liên kết tổ chức
  • Mã định danh tổ chức
  • ORCID iD
  • Ngày xuất bản
  • Tóm tắt
  • Tài liệu tham khảo
  • Tài trợ
  • Giấy phép
  • Thông tin phiên bản
  • Cập nhật và chỉnh sửa

Siêu dữ liệu bắt buộc và khuyến nghị của Crossref (crossref.org)

Crossref mô tả siêu dữ liệu của mình là một tài nguyên chia sẻ có thể được truy cập thông qua giao diện web, giao diện lập trình ứng dụng và tải xuống hàng loạt. Các hệ thống hạ nguồn có thể sử dụng thông tin đó để khám phá và kết nối các sản phẩm học thuật. Truy xuất siêu dữ liệu Crossref (crossref.org)

DataCite phục vụ chức năng tương tự cho các tập dữ liệu và nhiều sản phẩm nghiên cứu khác. Schema Metadata 4.7 hiện tại của nó, được phát hành vào ngày 3 tháng 3 năm 2026, hỗ trợ người tạo, người đóng góp, mã định danh ORCID, liên kết, mã định danh tổ chức, mã định danh liên quan, tài trợ, mô tả và loại tài nguyên. Schema Metadata DataCite (schema.datacite.org)

DataCite đặc biệt khuyến nghị kết nối hồ sơ người tạo và người đóng góp với mã định danh ORCID và các liên kết tổ chức với mã định danh tổ chức. Mã định danh tên DataCite (support.datacite.org)

DOI không phải là một huy hiệu chất lượng

Một DOI chứng minh rằng một hồ sơ tồn tại trong hệ thống đăng ký DOI. Nó không chứng minh rằng:

  • Nghiên cứu là đúng
  • Ấn phẩm đã được bình duyệt
  • Tạp chí có uy tín
  • Tác giả là một chuyên gia
  • Các phát hiện là quan trọng

Crossref làm rõ điểm này: bản thân DOI không biểu thị giá trị hay độ chính xác của đối tượng. Siêu dữ liệu xung quanh cung cấp ngữ cảnh và cho phép kết nối. Hướng dẫn DOI của Crossref (support.crossref.org)

Đây là lý do tại sao một hồ sơ DOI hoàn chỉnh hữu ích hơn nhiều so với một chuỗi DOI được đặt ở cuối trang.

Vai trò người đóng góp bổ sung ý nghĩa

Vào tháng 7 năm 2026, Crossref Schema 5.5 đã bổ sung hỗ trợ tốt hơn cho nhiều vai trò người đóng góp, tác giả liên hệ và Phân loại Vai trò Người đóng góp. Crossref Schema 5.5 (crossref.org)

Phân loại Vai trò Người đóng góp chứa 14 vai trò, bao gồm:

  • Khái niệm hóa
  • Quản lý dữ liệu
  • Phân tích chính thức
  • Điều tra
  • Phương pháp luận
  • Phần mềm
  • Giám sát
  • Xác thực
  • Trực quan hóa
  • Viết bản thảo gốc
  • Viết, xem xét và chỉnh sửa

Phân loại này được thiết kế để làm cho các đóng góp minh bạch hơn và hỗ trợ công nhận, trách nhiệm giải trình, đánh giá nghiên cứu và tính toàn vẹn của nghiên cứu. Phân loại Vai trò Người đóng góp (credit.niso.org)

Đối với các hệ thống trí tuệ nhân tạo, điều này tạo ra một câu trả lời phong phú hơn là “Jane Smith là một tác giả.” Một hệ thống có thể phân biệt giữa:

  • Người đã thiết kế nghiên cứu
  • Người đã viết phần mềm
  • Người đã phân tích dữ liệu
  • Người đã giám sát dự án
  • Người đã viết bản thảo gốc

Điều đó đặc biệt quan trọng đối với các nhóm nghiên cứu lớn và các dự án kỹ thuật.

3. Hồ sơ Học giả: Lớp Ngữ cảnh

Hồ sơ học giả giúp đồ thị danh tính dễ hiểu đối với con người và dễ dàng hơn cho các hệ thống tìm kiếm diễn giải.

Một hồ sơ vững chắc nên bao gồm:

  • Một trang tổ chức ổn định
  • Một tên nhất quán
  • Các biến thể tên khi thích hợp
  • ORCID iD
  • Các liên kết hiện tại và quá khứ
  • Lĩnh vực nghiên cứu
  • Các công trình chọn lọc với liên kết DOI
  • Tập dữ liệu, phần mềm và báo cáo
  • Tài trợ và giải thưởng
  • Vai trò biên tập hoặc bình duyệt
  • Vai trò người đóng góp
  • Ngày tháng cho các vị trí hiện tại và quá khứ
  • Ngày xem xét gần nhất
  • Liên kết đến các hồ sơ công khai khác

Hồ sơ Google Scholar cho phép các nhà nghiên cứu liệt kê các ấn phẩm, công khai hồ sơ, xem ai trích dẫn công trình của họ và theo dõi các số liệu trích dẫn. Một hồ sơ công khai với địa chỉ email tổ chức đã được xác minh có thể đủ điều kiện xuất hiện trong kết quả tìm kiếm của Google Scholar. Hồ sơ Google Scholar (scholar.google.com)

Tuy nhiên, Google Scholar nên được coi là một lớp hiển thị và khám phá, chứ không phải là nguồn sự thật chính. Các nhà nghiên cứu có thể quản lý danh sách ấn phẩm của riêng họ, và việc đối sánh tự động có thể bao gồm các công trình không chính xác hoặc trùng lặp. Số lượng trích dẫn cũng khác nhau giữa các cơ sở dữ liệu.

OpenAlex cung cấp một lớp khám phá hữu ích khác. Nó duy trì các hồ sơ tác giả được phân biệt rõ ràng và kết nối các tác giả, công trình, tổ chức, nguồn và chủ đề. OpenAlex cho biết nó lấy thông tin từ các nguồn như Crossref và DataCite, sau đó đối sánh các tác giả với ORCID iD và các liên kết với mã định danh tổ chức. Mô tả hệ sinh thái OpenAlex (help.openalex.org)

Do đó, phương pháp tốt nhất là liên kết hồ sơ (profile federation):

text Institutional author page ↕ ORCID record ↕ Crossref or DataCite work records ↕ OpenAlex and Google Scholar profiles ↕ Publisher, repository, funder, and professional pages

Không có một hồ sơ đơn lẻ nào cần chứa mọi thứ. Chúng nên trỏ đến nhau và sử dụng cùng một mã định danh.

Cách các tín hiệu này có thể ảnh hưởng đến trích dẫn của Trí tuệ nhân tạo

Điều quan trọng là phải phân biệt năm sự kiện khác nhau:

  1. Khám phá: Một hệ thống có thể tìm thấy trang hoặc công trình không?
  2. Xác định danh tính: Nó có thể cho biết người và tổ chức nào liên quan không?
  3. Truy xuất: Hệ thống có đưa công trình vào bộ bằng chứng của nó không?
  4. Chọn trích dẫn: Nó có trích dẫn công trình trong câu trả lời không?
  5. Độ chính xác của trích dẫn: Trích dẫn có chỉ đến đúng công trình và hỗ trợ tuyên bố không?

Siêu dữ liệu ORCID, DOI và hồ sơ học giả có thể giúp trực tiếp nhất với ba bước đầu tiên. Chúng cũng có thể cải thiện độ chính xác của trích dẫn. Ảnh hưởng của chúng đến việc chọn trích dẫn có thể phụ thuộc vào sự liên quan của chủ đề, chất lượng nguồn, tính cập nhật, khả năng tiếp cận và hệ thống trí tuệ nhân tạo cụ thể.

Tài liệu Google Search khuyến nghị sử dụng trang tác giả, url và các liên kết sameAs để giúp xác định tác giả bài viết. Đối với các tập dữ liệu, Google đặc biệt khuyến nghị sử dụng ORCID iD trong thuộc tính sameAs cho người tạo cá nhân. Dữ liệu có cấu trúc bài viết của Google Dữ liệu có cấu trúc tập dữ liệu của Google (developers.google.com)

Một trang hồ sơ đơn giản có thể sử dụng dữ liệu có cấu trúc như sau:

{ "@context": "https://schema.org", "@type": "Person", "@id": "https://institution.edu/people/jane-doe#person", "name": "Jane Doe", "url": "https://institution.edu/people/jane-doe", "sameAs": [ "https://orcid.org/0000-0000-0000-0000", "https://scholar.google.com/citations?user=EXAMPLE", "https://openalex.org/authors/A0000000000" ], "affiliation": { "@type": "Organization", "name": "Example University", "sameAs": "https://ror.org/000000000" }, "subjectOf": [ { "@type": "ScholarlyArticle", "identifier": "https://doi.org/10.0000/example" } ] }

Dữ liệu có cấu trúc không đảm bảo một tính năng tìm kiếm hoặc trích dẫn trí tuệ nhân tạo. Google tuyên bố rằng ngay cả dữ liệu có cấu trúc được triển khai đúng cách cũng có thể không xuất hiện trong kết quả tìm kiếm. Giá trị của nó là cung cấp cho máy móc một cách rõ ràng, tiêu chuẩn để diễn giải trang. Hướng dẫn dữ liệu có cấu trúc của Google (developers.google.com)

Kết luận thực tế là:

Các mã định danh cải thiện con đường dẫn đến bằng chứng. Chúng không thay thế bằng chứng.

Nghiên cứu hiện tại nói gì về trích dẫn của Trí tuệ nhân tạo

Nghiên cứu về hành vi trích dẫn của trí tuệ nhân tạo chủ yếu nghiên cứu về độ chính xác của trích dẫn, lựa chọn nguồn và khả năng xác minh. Nó vẫn chưa đưa ra ước tính tổng quát, đáng tin cậy về ảnh hưởng của sức mạnh danh tính được liên kết với ORCID.

Một nghiên cứu năm 2023 về các trích dẫn do ChatGPT tạo ra đã phát hiện tỷ lệ đáng kể các tài liệu tham khảo bịa đặt và lỗi trong các tài liệu tham khảo thực tế. Nghiên cứu đã kiểm tra 636 trích dẫn được tạo ra trên 84 bài báo và phát hiện rằng các vấn đề về trích dẫn vẫn còn tồn tại ngay cả trong mô hình mới hơn được thử nghiệm. Nghiên cứu của Scientific Reports (nature.com)

Một nghiên cứu khác về các công cụ tìm kiếm tạo sinh đã phát hiện ra rằng nhiều câu được tạo ra không được hỗ trợ đầy đủ bởi các trích dẫn và nhiều trích dẫn không hỗ trợ đầy đủ các tuyên bố bên cạnh chúng. Đánh giá khả năng xác minh trong các Công cụ tìm kiếm Tạo sinh (arxiv.org)

Nghiên cứu gần đây cũng cho thấy các hệ thống tìm kiếm tạo sinh khác nhau về lựa chọn nguồn, sự trùng lặp nguồn, độ ổn định và việc sử dụng kiến thức nội bộ so với kiến thức bên ngoài. Đặc điểm tìm kiếm web trong kỷ nguyên trí tuệ nhân tạo tạo sinh (aclanthology.org)

Những phát hiện này ủng hộ một quan điểm thận trọng:

  • Một DOI có thể giảm sự mơ hồ về công trình được trích dẫn.
  • ORCID có thể giảm sự mơ hồ về cá nhân.
  • Mã định danh liên kết có thể giảm sự mơ hồ về tổ chức.
  • Vai trò người đóng góp có thể cải thiện việc ghi công.
  • Một hồ sơ công khai có thể cung cấp ngữ cảnh.
  • Không có tín hiệu nào trong số này đảm bảo rằng một hệ thống sẽ truy xuất hoặc trích dẫn công trình.

Một Chương trình Nghiên cứu để Đo lường Sức mạnh Danh tính và Tần suất Trích dẫn của Trí tuệ nhân tạo

Các tổ chức không nên tuyên bố rằng trung tâm tác giả cải thiện các trích dẫn trí tuệ nhân tạo cho đến khi họ đo lường trực tiếp mối quan hệ này.

Xác định điểm mạnh danh tính tác giả

Sau đây là một điểm đề xuất, không phải là một tiêu chuẩn chính thức.

Thành phầnĐiểm đề xuấtĐo lường
ORCID iD đã xác thực15Nhà nghiên cứu đã xác nhận iD thông qua ủy quyền ORCID
Liên kết ORCID-tới-công trình15Các công trình trong hồ sơ ORCID khớp với hồ sơ DOI
Chất lượng nguồn ORCID10Các tuyên bố quan trọng đến từ nhà xuất bản, nhà tài trợ hoặc tổ chức
DOI hoàn chỉnh15Hồ sơ DOI bao gồm tác giả, ORCID, liên kết, ngày tháng, tóm tắt và tài liệu tham khảo khi liên quan
Liên kết tổ chức10Liên kết bao gồm mã định danh tổ chức bền vững
Vai trò người đóng góp10Hồ sơ công trình bao gồm các vai trò đóng góp rõ ràng
Hồ sơ tổ chức10Trang tác giả ổn định, công khai, hiện tại tồn tại
Liên kết hồ sơ học giả5Hồ sơ Google Scholar và OpenAlex liên kết đến cùng một người
Tính cập nhật10Hồ sơ và thông tin đã được xem xét trong vòng một năm qua
Tổng cộng100

Không bao gồm số lượng trích dẫn, uy tín tạp chí hoặc xếp hạng tổ chức trong điểm số này. Các yếu tố đó nên được coi là các biến riêng biệt. Việc bao gồm chúng sẽ gây khó khăn trong việc xác định liệu bản thân sức mạnh danh tính có liên quan đến tần suất trích dẫn hay không.

Đo lường nhiều loại trích dẫn

Một nghiên cứu hữu ích nên theo dõi ít nhất sáu kết quả:

  1. Tỷ lệ trích dẫn công trình
    Tỷ lệ phần trăm các câu trả lời đủ điều kiện trích dẫn một công trình cụ thể.

  2. Tỷ lệ ghi công tác giả
    Tỷ lệ phần trăm các câu trả lời đặt tên hoặc ghi công công trình đúng cho tác giả.

  3. Tỷ lệ mã định danh hợp lệ
    Tỷ lệ phần trăm các trích dẫn chứa DOI dẫn đến đúng công trình.

  4. Độ chính xác của trích dẫn
    Tỷ lệ phần trăm các trích dẫn thực sự hỗ trợ tuyên bố được đưa ra.

  5. Độ bao phủ của trích dẫn (Citation recall)
    Tỷ lệ phần trăm các nguồn hỗ trợ quan trọng mà hệ thống trích dẫn.

  6. Độ ổn định đa nền tảng
    Tỷ lệ phần trăm các trích dẫn được lặp lại trên các hệ thống khác nhau hoặc các lần chạy lặp lại.

Một khuôn khổ đo lường gần đây cho tìm kiếm tạo sinh phân tách lựa chọn trích dẫn khỏi hấp thụ trích dẫn, nghĩa là liệu một nguồn chỉ xuất hiện trong danh sách trích dẫn hay thực sự đóng góp bằng chứng vào câu trả lời. Sự phân biệt này nên được đưa vào các nghiên cứu trung tâm tác giả trong tương lai. Khuôn khổ lựa chọn trích dẫn và hấp thụ trích dẫn (arxiv.org)

Nghiên cứu một: Nghiên cứu tương quan quan sát

Nghiên cứu này đặt câu hỏi:

Liệu các công trình được kết nối với danh tính tác giả mạnh hơn có được các hệ thống trí tuệ nhân tạo trích dẫn thường xuyên hơn sau khi kiểm soát các yếu tố chủ đề và xuất bản?

Thiết kế đề xuất

  • Lấy mẫu từ 10.000 đến 50.000 công trình học thuật
  • Bao gồm nhiều lĩnh vực, ngôn ngữ và loại ấn phẩm
  • Sử dụng dữ liệu Crossref, DataCite, OpenAlex và ORCID công khai
  • Tính điểm mạnh danh tính cho từng tác giả và công trình
  • Tạo một bộ câu hỏi mà các công trình được lấy mẫu có liên quan
  • Chạy các câu hỏi trên nhiều hệ thống tạo trích dẫn
  • Lặp lại mỗi câu hỏi nhiều lần
  • Ghi lại ngày, hệ thống, cài đặt mô hình, khu vực và các nguồn được trích dẫn

Các biến kiểm soát quan trọng

Nghiên cứu nên kiểm soát các yếu tố:

  • Mức độ liên quan của chủ đề
  • Năm xuất bản
  • Trạng thái truy cập mở
  • Tính khả dụng của tóm tắt
  • Tính khả dụng của toàn văn
  • Địa điểm
  • Số lượng trích dẫn học thuật hiện có
  • Danh tiếng của tổ chức
  • Ngôn ngữ
  • Tốc độ trang và khả năng thu thập dữ liệu
  • Loại công trình
  • Mức độ phổ biến của tên tác giả
  • Số lượng đồng tác giả
  • Cách diễn đạt truy vấn
  • Hệ thống tìm kiếm

Mô hình thống kê chính có thể ước tính:

text Probability of correct citation = identity strength

  • topical relevance
  • work age
  • open access
  • scholarly citations
  • system
  • query
  • author and topic controls

Hồi quy logistic hoặc mô hình hiệu ứng hỗn hợp sẽ phù hợp cho kết quả có/không chẳng hạn như liệu một công trình có được trích dẫn hay không. Mô hình nhị thức âm có thể hữu ích cho số lượng trích dẫn vì dữ liệu trích dẫn thường phân bố không đều.

Kết quả nên được báo cáo dưới dạng tỷ số chênh với khoảng tin cậy, không phải là một tỷ lệ phần trăm đơn giản. Ví dụ:

Sự gia tăng một độ lệch chuẩn về sức mạnh danh tính có liên quan đến sự thay đổi trong xác suất trích dẫn sau khi kiểm soát các yếu tố liên quan, tuổi, khả năng truy cập và sự chú ý học thuật trước đó.

Nghiên cứu cũng nên báo cáo các kết quả không có ý nghĩa thống kê (null results). Việc tìm thấy không có mối quan hệ sẽ hữu ích vì nó sẽ cho thấy rằng các mã định danh cải thiện chất lượng dữ liệu mà không nhất thiết làm thay đổi hành vi trích dẫn của trí tuệ nhân tạo.

Nghiên cứu hai: Thí nghiệm siêu dữ liệu có kiểm soát

Một nghiên cứu quan sát có thể nhầm lẫn sức mạnh danh tính với sự phổ biến. Một thí nghiệm có kiểm soát có thể cô lập một số hiệu ứng.

Có hai phiên bản thực tế.

Phiên bản A: Thí nghiệm web công khai

Tạo các trang được đối sánh với cùng nội dung thực chất nhưng cách xử lý siêu dữ liệu khác nhau:

  • Chỉ tên tác giả cơ bản
  • Tên tác giả cộng với hồ sơ tổ chức
  • Tên tác giả cộng với liên kết ORCID
  • Tên tác giả, ORCID, DOI, mã định danh liên kết và dữ liệu có cấu trúc

Xuất bản các trang cùng lúc và theo dõi:

  • Khám phá tìm kiếm
  • Đối sánh tác giả chính xác
  • Truy xuất vào các câu trả lời trí tuệ nhân tạo
  • Tần suất trích dẫn
  • Độ chính xác của trích dẫn

Thí nghiệm này phải được diễn giải cẩn thận. Các hệ thống công khai có thể thu thập dữ liệu các trang vào những thời điểm khác nhau, và các tổ chức không thể dễ dàng thay đổi hồ sơ Crossref hoặc DataCite cho một công trình đã xuất bản.

Phiên bản B: Chỉ mục nghiên cứu có kiểm soát

Xây dựng một hệ thống truy xuất nhỏ chứa cùng các tài liệu dưới các điều kiện siêu dữ liệu khác nhau. Chỉ thay đổi:

  • Mã định danh tác giả
  • DOI
  • Liên kết tổ chức
  • Vai trò người đóng góp
  • Liên kết hồ sơ
  • Các trường nguồn gốc

Sau đó đặt cùng các câu hỏi và đo lường truy xuất và lựa chọn trích dẫn. Thí nghiệm này cho phép kiểm soát tốt hơn, nhưng nó đo lường một hệ thống nghiên cứu hơn là các nền tảng thương mại.

Nghiên cứu ba: Triển khai theo giai đoạn của tổ chức

Thiết kế thực tế mạnh mẽ nhất là một nghiên cứu khác biệt trong khác biệt (difference-in-differences study).

Một tổ chức có thể triển khai trung tâm tác giả theo các giai đoạn:

  • Khoa Một nhận chương trình đầy đủ vào tháng 10 năm 2026.
  • Khoa Hai nhận vào tháng 1 năm 2027.
  • Khoa Ba nhận vào tháng 4 năm 2027.

Tất cả các khoa được đo lường trước và sau khi thực hiện. Các khoa chưa nhận chương trình đóng vai trò là nhóm so sánh tạm thời.

Đo lường:

  • Ghi công tác giả chính xác
  • Phân giải DOI
  • Tần suất trích dẫn
  • Độ chính xác của trích dẫn
  • Lượt hiển thị tìm kiếm
  • Lượt truy cập trang hồ sơ
  • Thời gian cần thiết để sửa siêu dữ liệu sai

Thiết kế này mạnh hơn so với so sánh đơn giản trước và sau vì nó giúp tách biệt hiệu ứng của việc triển khai khỏi những thay đổi rộng hơn trong các hệ thống trí tuệ nhân tạo.

Các giả thuyết đáng để kiểm tra

Các tổ chức có thể đăng ký trước các giả thuyết này:

  • H1: Liên kết danh tính mạnh hơn cải thiện việc ghi công tác giả chính xác.
  • H2: Siêu dữ liệu DOI hoàn chỉnh cải thiện tỷ lệ trích dẫn hợp lệ.
  • H3: Mã định danh liên kết hữu ích nhất khi các tác giả có tên phổ biến hoặc di chuyển giữa các tổ chức.
  • H4: Hồ sơ học giả cải thiện khám phá nhiều hơn là cải thiện tần suất trích dẫn cuối cùng.
  • H5: Sức mạnh danh tính có ảnh hưởng lớn hơn đối với các tác giả "long-tail" (ít nổi tiếng) so với các tác giả đã nổi tiếng.
  • H6: Ảnh hưởng khác nhau tùy theo hệ thống, chủ đề, ngôn ngữ và loại ấn phẩm.
  • H7: Tính cập nhật và sự liên quan của chủ đề quan trọng hơn là trang trí hồ sơ.

Những Bằng cấp nào nên được Công bố?

Một hồ sơ nên công bố các bằng cấp có thể kiểm tra được. Mỗi bằng cấp nên có:

  • Loại bằng cấp
  • Người sở hữu
  • Tổ chức cấp phát
  • Mã định danh bền vững cho tổ chức khi có sẵn
  • Ngày bắt đầu và kết thúc
  • Nguồn xác minh
  • Trạng thái như hiện tại, hết hạn, đang tranh chấp hoặc đã lưu trữ
  • Ngày xem xét gần nhất
Bằng cấpBằng chứng có thể công bố
Việc làmTổ chức, mã định danh tổ chức, bộ phận, ngày bắt đầu, ngày kết thúc
Học vấnBằng cấp, tổ chức cấp bằng, năm hoàn thành, nguồn xác minh
Tài trợNhà tài trợ, số giải thưởng, vai trò, ngày tháng, trang dự án
Ấn phẩmDOI, tác giả, liên kết tổ chức, vai trò người đóng góp
Tập dữ liệuDataCite DOI, người tạo, giấy phép, phiên bản, kho lưu trữ
Phần mềmKho lưu trữ, bản phát hành, DOI, giấy phép, vai trò
Dịch vụ biên tậpTạp chí, vai trò, ngày bắt đầu, ngày kết thúc
Bình duyệtHồ sơ bình duyệt công khai hoặc hồ sơ dịch vụ đã xác minh khi được phép
Giải thưởngCơ quan cấp, tên giải thưởng, năm, thông báo công khai
Chứng nhậnTổ chức cấp, số chứng nhận, ngày cấp, ngày hết hạn

Các tổ chức nên dán nhãn nguồn của mỗi bằng cấp:

  • Tự báo cáo
  • Được tổ chức xác minh
  • Được nhà xuất bản xác minh
  • Được nhà tài trợ xác minh
  • Nhập từ một cơ quan đăng ký
  • Đang chờ xem xét

Tránh công bố các nhãn không có căn cứ như “chuyên gia hàng đầu” hoặc “nhà nghiên cứu nổi tiếng thế giới.” Thay thế chúng bằng bằng chứng:

  • Số lượng và loại công trình
  • Lĩnh vực nghiên cứu
  • Vai trò đã được xác minh
  • Các dự án được tài trợ
  • Dịch vụ biên tập
  • Tập dữ liệu hoặc phần mềm công khai
  • Bổ nhiệm tại tổ chức

Cách tiếp cận này hữu ích hơn cho cả người đọc và máy móc.

Kế hoạch Triển khai cho các Tổ chức

Giai đoạn một: Tạo chính sách siêu dữ liệu

Chỉ định một nhóm quản trị nhỏ với các đại diện từ:

  • Quản lý nghiên cứu
  • Dịch vụ thư viện
  • Công nghệ thông tin
  • Truyền thông
  • Dịch vụ xuất bản hoặc kho lưu trữ
  • Quyền riêng tư
  • Tính toàn vẹn của nghiên cứu

Tạo một chính sách dữ liệu ngắn gọn định nghĩa:

  • Các trường bắt buộc
  • Các hệ thống mã định danh được phê duyệt
  • Ai có thể khẳng định mỗi trường
  • Các trường nào là công khai
  • Cách xử lý các chỉnh sửa
  • Thời gian cập nhật nên mất bao lâu
  • Điều gì xảy ra khi một người rời đi

Sử dụng một hợp đồng dữ liệu duy nhất trên các hệ thống. Tối thiểu, mọi hồ sơ cá nhân, công trình, tổ chức và bằng cấp nên có:

text persistent_id display_name source asserted_by valid_from valid_to last_verified status evidence_url

Giai đoạn hai: Thu thập các mã định danh đã xác thực

Yêu cầu các nhà nghiên cứu kết nối hồ sơ ORCID của họ thông qua một quy trình xác thực. Không để tổ chức chịu trách nhiệm đoán xem ORCID iD nào thuộc về một người.

Đồng thời:

  • Gán mã định danh tổ chức cho các khoa và tổ chức
  • Liên kết hồ sơ nhân viên với ORCID
  • Đối sánh các ấn phẩm hiện có với hồ sơ DOI
  • Đánh dấu các xung đột tên
  • Bảo toàn các dạng tên thay thế
  • Ghi lại cài đặt đồng ý và khả năng hiển thị

Giai đoạn ba: Cải thiện siêu dữ liệu DOI

Đối với các công trình mới, yêu cầu quy trình xuất bản thu thập:

  • Tên tác giả đầy đủ
  • ORCID iD đã xác thực
  • Liên kết tổ chức
  • Mã định danh tổ chức
  • Vai trò người đóng góp
  • Mã định danh tài trợ
  • Tóm tắt
  • Tài liệu tham khảo
  • Giấy phép
  • Thông tin phiên bản và cập nhật

Đối với các công trình cũ hơn, bắt đầu với năm năm gần nhất và các tác giả được tổ chức sử dụng nhiều nhất.

Crossref và DataCite nên nhận được các chỉnh sửa và cập nhật chứ không chỉ là bản gửi ban đầu. Chuỗi DOI vẫn bền vững, trong khi siêu dữ liệu liên quan có thể được duy trì. Bảo trì siêu dữ liệu Crossref (crossref.org)

Giai đoạn bốn: Xây dựng các trang tác giả chính thống

Mỗi nhà nghiên cứu nên có một trang tổ chức ổn định. Trang đó nên:

  • Sử dụng một địa chỉ web vĩnh viễn
  • Hiển thị vai trò hiện tại
  • Bảo toàn các vai trò trước đó với ngày tháng
  • Liên kết đến ORCID
  • Liên kết đến các hồ sơ DOI chọn lọc
  • Liên kết đến các hồ sơ học giả công khai
  • Hiển thị các lĩnh vực nghiên cứu
  • Hiển thị ngày cập nhật gần nhất
  • Sử dụng dữ liệu có cấu trúc
  • Luôn có thể truy cập được đối với các công cụ thu thập dữ liệu tìm kiếm
  • Tránh yêu cầu đăng nhập

Google khuyến nghị sử dụng URL tác giả rõ ràng và các liên kết sameAs để giúp phân biệt các tác giả. Hướng dẫn đánh dấu tác giả của Google (developers.google.com)

Giai đoạn năm: Liên kết và giám sát hồ sơ

Liên kết trang tổ chức với:

  • ORCID
  • Google Scholar
  • OpenAlex
  • Trang nhà xuất bản
  • Hồ sơ kho lưu trữ
  • Trang tài trợ
  • Hồ sơ chuyên nghiệp công khai khi thích hợp

Sử dụng kiểm tra tự động để tìm:

  • Liên kết DOI bị hỏng
  • Liên kết ORCID bị thiếu
  • Tác giả trùng lặp
  • Đối sánh đồng tác giả sai
  • Liên kết tổ chức cũ
  • Bằng cấp hết hạn
  • Ngày cập nhật bị thiếu
  • Tên không khớp
  • Rút lại hoặc chỉnh sửa

Quản trị việc Cập nhật và Thay đổi Vai trò

Một trung tâm tác giả phải bảo toàn lịch sử. Nó không nên viết lại quá khứ mỗi khi một người thay đổi công việc.

Hệ thống phân cấp nguồn được khuyến nghị

Thông tinQuyền hạn chính
Tên do cá nhân kiểm soát và khả năng hiển thị công khaiNhà nghiên cứu và ORCID
Việc làm hiện tạiTổ chức
Tác giả ấn phẩmNhà xuất bản và cơ quan đăng ký DOI
Vai trò người đóng gópNhà xuất bản, hồ sơ dự án hoặc chỉnh sửa chính thức
Giải thưởng tài trợNhà tài trợ
Bằng cấp hoặc chứng nhậnTổ chức cấp phát
Trình bày hồ sơ công khaiTổ chức, với sự xem xét của nhà nghiên cứu

Khi một nhà nghiên cứu thay đổi tổ chức

Không xóa liên kết cũ khỏi các công trình lịch sử.

Thay vào đó:

  1. Thêm ngày kết thúc vào hồ sơ việc làm trước đây.
  2. Thêm liên kết mới với ngày bắt đầu.
  3. Cập nhật hồ sơ tổ chức.
  4. Giữ nguyên các liên kết ấn phẩm lịch sử trừ khi nhà xuất bản ban hành một bản chỉnh sửa.
  5. Cập nhật hồ sơ ORCID thông qua nguồn thích hợp.
  6. Chuyển hướng trang hồ sơ cũ đến một trang đã lưu trữ hoặc trang mới.

Khi một người thay đổi tên

Sử dụng ORCID để kết nối các biến thể tên. Thêm tên cũ hoặc tên thay thế nếu nhà nghiên cứu đồng ý. Không thay đổi tên tác giả trong hồ sơ DOI đã xuất bản chỉ để làm cho nó khớp với một hồ sơ hiện tại.

Mục đích của mã định danh bền vững là kết nối các công trình qua các thay đổi tên mà không cần viết lại hồ sơ xuất bản.

Khi vai trò của người đóng góp thay đổi

Vai trò của người đóng góp trong một công trình đã hoàn thành nên được coi là một phần của hồ sơ lịch sử.

Ví dụ:

  • Vai trò của một người trong một bài báo đã xuất bản không nên thay đổi chỉ vì sau này họ trở thành chủ nhiệm khoa.
  • Một vai trò biên tập nên có ngày bắt đầu và kết thúc.
  • Một vai trò tài trợ nên gắn với thời gian tài trợ.
  • Một vai trò phần mềm nên gắn với phiên bản hoặc bản phát hành.

Nếu hồ sơ đóng góp ban đầu sai, hãy sử dụng quy trình chỉnh sửa chính thức. Không âm thầm ghi đè lên nó.

Khi một bằng cấp hết hạn

Sử dụng các giá trị trạng thái rõ ràng:

  • Hiện tại
  • Hết hạn
  • Đã gia hạn
  • Bị đình chỉ
  • Đang tranh chấp
  • Đã lưu trữ

Lời nhắc tự động nên được gửi trước khi hết hạn. Hồ sơ công khai nên hiển thị trạng thái và ngày thay vì để một bằng cấp cũ hiển thị mà không có giải thích.

Khi một nhà nghiên cứu rời tổ chức

Tổ chức nên:

  • Bảo toàn hồ sơ lịch sử
  • Đánh dấu rõ ràng vai trò trước đây
  • Giữ lại các liên kết đến các công trình đã xuất bản
  • Chuyển quyền sở hữu hồ sơ
  • Đặt chuyển hướng cho trang cũ
  • Xóa thông tin liên hệ riêng tư
  • Giữ lại các khẳng định của tổ chức đã đúng trong thời gian làm việc trước đây

Khi quyền tác giả bị tranh chấp

Đóng băng trường bị tranh chấp, bảo toàn nguồn gốc và ghi lại tranh chấp. Không xóa tác giả hoặc thay đổi vai trò đóng góp chỉ dựa trên một yêu cầu không chính thức.

Văn phòng liêm chính nghiên cứu, nhà xuất bản, hoặc cơ quan dự án có trách nhiệm nên xác định con đường chỉnh sửa chính thức.

Các Biện pháp Thành công

Các tổ chức nên theo dõi chất lượng vận hành trước khi hứa hẹn tăng cường khả năng hiển thị trí tuệ nhân tạo.

Các mục tiêu đề xuất bao gồm:

  • 95 phần trăm các nhà nghiên cứu đang hoạt động có ORCID iD đã được xác thực
  • 95 phần trăm các công trình mới bao gồm ORCID khi có sẵn
  • 95 phần trăm các liên kết tổ chức sử dụng mã định danh tổ chức bền vững
  • 100 phần trăm các bản gửi DOI mới vượt qua xác thực siêu dữ liệu
  • 100 phần trăm các trang tác giả chứa một địa chỉ hồ sơ ổn định
  • 100 phần trăm các thay đổi vai trò bao gồm ngày tháng
  • Dưới 1 phần trăm công trình bị gán sai cho tác giả
  • Các chỉnh sửa siêu dữ liệu được hoàn thành trong vòng 30 ngày
  • Các thay đổi việc làm hiện tại xuất hiện trong vòng bảy ngày
  • Các bản rút lại và chỉnh sửa chính thức được phản ánh kịp thời

Đối với nghiên cứu trích dẫn trí tuệ nhân tạo, theo dõi:

  • Tỷ lệ ghi công tác giả chính xác
  • Tỷ lệ DOI hợp lệ
  • Độ chính xác của trích dẫn
  • Độ bao phủ của trích dẫn
  • Tần suất trích dẫn công trình
  • Sự thống nhất giữa các hệ thống
  • Thời gian từ chỉnh sửa siêu dữ liệu đến cải thiện lập chỉ mục
  • Sự khác biệt giữa khám phá hồ sơ và trích dẫn câu trả lời cuối cùng

Tổ chức nên báo cáo các biện pháp này theo chuyên ngành, ngôn ngữ, giai đoạn sự nghiệp và mức độ phổ biến của tên. Nếu không, một điểm trung bình có thể che giấu các kết quả không đồng đều.

Rủi ro và Biện pháp Bảo vệ

Trung tâm tác giả có thể tạo ra những rủi ro mới nếu chúng trở thành một hệ thống kiểm soát.

Các tổ chức không nên:

  • Phạt các nhà nghiên cứu giữ một số thông tin ORCID riêng tư
  • Coi một hồ sơ Google Scholar công khai là bằng chứng về chất lượng
  • Sử dụng số lượng trích dẫn thay thế cho bình duyệt
  • Công bố chi tiết liên hệ cá nhân một cách không cần thiết
  • Suy ra chuyên môn chỉ từ uy tín của tổ chức
  • Yêu cầu mọi nhà nghiên cứu sử dụng cùng một dịch vụ hồ sơ công khai
  • Coi việc thiếu mã định danh là bằng chứng về hành vi sai trái
  • Cho phép các hệ thống tự động ghi đè hồ sơ mà không xem xét

Việc áp dụng ORCID và chất lượng siêu dữ liệu khác nhau tùy theo lĩnh vực, quốc gia, giai đoạn sự nghiệp và loại ấn phẩm. Một hệ thống công bằng phải hỗ trợ chỉnh sửa thủ công, kiểm soát quyền riêng tư, đa dạng tên và những người có công trình không được thể hiện tốt bằng các số liệu xuất bản tạp chí.

Kết luận

Một trung tâm tác giả mạnh mẽ không phải là một dự án xây dựng thương hiệu cá nhân. Nó là một hệ thống bằng chứng có thể đọc được bằng máy.

  • ORCID kết nối một người với một danh tính bền vững.
  • Crossref và DataCite kết nối các công trình với các mã định danh ổn định và siêu dữ liệu phong phú.
  • Mã định danh Đăng ký Tổ chức Nghiên cứu kết nối con người và công trình với các tổ chức.
  • Vai trò người đóng góp cho thấy mỗi người thực sự đã làm gì.
  • Hồ sơ tổ chức và hồ sơ học giả cung cấp ngữ cảnh công khai.
  • Dữ liệu có cấu trúc giúp các hệ thống tìm kiếm diễn giải các mối quan hệ.
  • Quản trị và lịch sử phiên bản cho thấy những gì hiện tại, những gì đã đúng trong quá khứ và ai đã xác nhận mỗi tuyên bố.

Lợi ích có khả năng không phải là một sự tăng hạng tự động. Lợi ích là một chuỗi mạnh mẽ hơn từ người → công trình → tổ chức → bằng chứng.

Do đó, các tổ chức nên đưa ra hai cam kết:

  1. Tiêu chuẩn hóa và duy trì siêu dữ liệu.
  2. Đo lường hành vi trích dẫn của trí tuệ nhân tạo thay vì giả định một tác động.

Trung tâm tác giả đáng tin cậy nhất không phải là trung tâm có nhiều huy hiệu nhất. Đó là trung tâm mà các tuyên bố quan trọng của nó là bền vững, được kết nối, có nguồn gốc, cập nhật và dễ dàng xác minh.

Bài viết liên quan

Thích nội dung này?

Đăng ký nhận bản tin của chúng tôi để biết thông tin chi tiết về content marketing và hướng dẫn tăng trưởng mới nhất.

Bài viết này chỉ dành cho mục đích thông tin. Nội dung và chiến lược có thể thay đổi tùy theo nhu cầu cụ thể của bạn.
Xây dựng Trung tâm Tác giả: ORCID, Crossref và Hồ sơ Học giả như các Yếu tố Tin cậy Cơ bản | AutoPod