huggingface-paper-publisher

huggingface-paper-publisher

熱門

在 Hugging Face Hub 上發布和管理研究論文。支援建立論文頁面、將論文連結到模型/資料集、聲明作者身份,以及產生專業的 Markdown 研究文章。

1.1萬星標
737分支
更新於 2026/8/27
SKILL.md
唯讀
名稱
huggingface-paper-publisher
描述

在 Hugging Face Hub 上發布和管理研究論文。支援建立論文頁面、將論文連結到模型/資料集、聲明作者身份,以及產生專業的 Markdown 研究文章。

總覽

此技能為 AI 工程師和研究人員提供在 Hugging Face Hub 上發布、管理和連結研究論文的完整工具。它簡化了從論文建立到發布的工作流程,包括與 arXiv 的整合、模型/資料集連結,以及作者身份管理。

與 HF 生態系的整合

  • 論文頁面:在 Hugging Face Hub 上索引和探索論文
  • arXiv 整合:從 arXiv ID 自動索引論文
  • 模型/資料集連結:透過中繼資料將論文連接到相關工件
  • 作者身份驗證:聲明和驗證論文作者身份
  • 研究文章範本:產生專業、現代的科學論文

版本

1.0.0

相依套件

包含的腳本使用 PEP 723 內聯相依套件。建議使用 uv run 而非手動設定環境。

  • huggingface_hub>=0.26.0
  • pyyaml>=6.0.3
  • requests>=2.32.5
  • markdown>=3.5.0
  • python-dotenv>=1.2.1

核心功能

1. 論文頁面管理

  • 索引論文:從 arXiv 新增論文到 Hugging Face
  • 聲明作者身份:驗證並聲明已發布論文的作者身份
  • 管理可見性:控制哪些論文顯示在你的個人檔案中
  • 論文探索:在 HF 生態系中尋找和探索論文

2. 將論文連結到工件

  • 模型卡:將論文引用新增到模型中繼資料
  • 資料集卡:透過 README 將論文連結到資料集
  • 自動標記:Hub 自動產生 arxiv:<PAPER_ID> 標籤
  • 引用管理:維護正確的歸屬和參考文獻

3. 研究文章建立

  • Markdown 範本:產生專業的論文格式
  • 現代設計:乾淨、易讀的研究文章版面
  • 動態目錄:自動產生目錄
  • 章節結構:標準的科學論文組織
  • LaTeX 數學:支援方程式和技術符號

4. 中繼資料管理

  • YAML Frontmatter:正確的模型/資料集卡中繼資料
  • 引用追蹤:跨儲存庫維護論文參考文獻
  • 版本控制:追蹤論文更新和修訂
  • 多論文支援:將多篇論文連結到單一工件

使用說明

此技能包含 scripts/ 中的 Python 腳本,用於論文發布操作。

先決條件

  • 使用 uv run 執行腳本(相依套件從腳本標頭解析)
  • 設定 HF_TOKEN 環境變數,使用具有寫入權限的 token

所有路徑都相對於包含此 SKILL.md 檔案的目錄。
在執行任何腳本之前,請先 cd 到該目錄或使用完整路徑。

方法 1:從 arXiv 索引論文

從 arXiv 新增論文到 Hugging Face 論文頁面。

基本用法:

uv run scripts/paper_manager.py index \
  --arxiv-id "2301.12345"

檢查論文是否存在:

uv run scripts/paper_manager.py check \
  --arxiv-id "2301.12345"

直接 URL 存取:
你也可以直接造訪 https://huggingface.co/papers/{arxiv-id} 來索引論文。

方法 2:將論文連結到模型/資料集

將論文參考文獻新增到模型或資料集 README,並包含正確的 YAML 中繼資料。

新增到模型卡:

uv run scripts/paper_manager.py link \
  --repo-id "username/model-name" \
  --repo-type "model" \
  --arxiv-id "2301.12345"

新增到資料集卡:

uv run scripts/paper_manager.py link \
  --repo-id "username/dataset-name" \
  --repo-type "dataset" \
  --arxiv-id "2301.12345"

新增多篇論文:

uv run scripts/paper_manager.py link \
  --repo-id "username/model-name" \
  --repo-type "model" \
  --arxiv-ids "2301.12345,2302.67890,2303.11111"

使用自訂引用:

uv run scripts/paper_manager.py link \
  --repo-id "username/model-name" \
  --repo-type "model" \
  --arxiv-id "2301.12345" \
  --citation "$(cat citation.txt)"
連結運作方式

當你將 arXiv 論文連結新增到模型或資料集 README 時:

  1. Hub 從連結中提取 arXiv ID
  2. 自動在儲存庫中新增標籤 arxiv:<PAPER_ID>
  3. 使用者可以點擊標籤來檢視論文頁面
  4. 論文頁面會顯示所有引用此論文的模型/資料集
  5. 論文可透過篩選器和搜尋來探索

方法 3:聲明作者身份

驗證你在 Hugging Face 上發布的論文作者身份。

開始聲明流程:

uv run scripts/paper_manager.py claim \
  --arxiv-id "2301.12345" \
  --email "your.email@institution.edu"

手動流程:

  1. 前往你的論文頁面:https://huggingface.co/papers/{arxiv-id}
  2. 在作者清單中找到你的名字
  3. 點擊你的名字並選擇「聲明作者身份」
  4. 等待管理團隊驗證

檢查作者身份狀態:

uv run scripts/paper_manager.py check-authorship \
  --arxiv-id "2301.12345"

方法 4:管理論文可見性

控制哪些已驗證的論文顯示在你的公開個人檔案中。

列出你的論文:

uv run scripts/paper_manager.py list-my-papers

切換可見性:

uv run scripts/paper_manager.py toggle-visibility \
  --arxiv-id "2301.12345" \
  --show true

在設定中管理:
前往你的帳號設定 → 論文區段,為每篇論文切換「在個人檔案中顯示」。

方法 5:建立研究文章

使用現代範本產生專業的 Markdown 研究論文。

從範本建立:

uv run scripts/paper_manager.py create \
  --template "standard" \
  --title "Your Paper Title" \
  --output "paper.md"

可用的範本:

  • standard - 傳統科學論文結構
  • modern - 乾淨、適合網頁的格式,靈感來自 Distill
  • arxiv - arXiv 風格格式
  • ml-report - 機器學習實驗報告

產生完整論文:

uv run scripts/paper_manager.py create \
  --template "modern" \
  --title "Fine-Tuning Large Language Models with LoRA" \
  --authors "Jane Doe, John Smith" \
  --abstract "$(cat abstract.txt)" \
  --output "paper.md"

轉換為 HTML:

uv run scripts/paper_manager.py convert \
  --input "paper.md" \
  --output "paper.html" \
  --style "modern"

論文範本結構

標準研究論文章節:

---
title: Your Paper Title
authors: Jane Doe, John Smith
affiliations: University X, Lab Y
date: 2025-01-15
arxiv: 2301.12345
tags: [machine-learning, nlp, fine-tuning]
---

# 摘要
簡短總結論文...

# 1. 引言
背景和動機...

# 2. 相關工作
先前研究和背景...

# 3. 方法
方法和實作...

# 4. 實驗
設定、資料集和程序...

# 5. 結果
發現和分析...

# 6. 討論
詮釋和影響...

# 7. 結論
總結和未來工作...

# 參考文獻

現代範本功能:

  • 動態目錄
  • 響應式設計,適合網頁檢視
  • 程式碼語法高亮
  • 互動式圖表和圖形
  • 數學方程式渲染(LaTeX)
  • 引用管理
  • 作者隸屬關係連結

指令參考

索引論文:

uv run scripts/paper_manager.py index --arxiv-id "2301.12345"

連結到儲存庫:

uv run scripts/paper_manager.py link \
  --repo-id "username/repo-name" \
  --repo-type "model|dataset|space" \
  --arxiv-id "2301.12345" \
  [--citation "Full citation text"] \
  [--create-pr]

聲明作者身份:

uv run scripts/paper_manager.py claim \
  --arxiv-id "2301.12345" \
  --email "your.email@edu"

管理可見性:

uv run scripts/paper_manager.py toggle-visibility \
  --arxiv-id "2301.12345" \
  --show true|false

建立研究文章:

uv run scripts/paper_manager.py create \
  --template "standard|modern|arxiv|ml-report" \
  --title "Paper Title" \
  [--authors "Author1, Author2"] \
  [--abstract "Abstract text"] \
  [--output "filename.md"]

將 Markdown 轉換為 HTML:

uv run scripts/paper_manager.py convert \
  --input "paper.md" \
  --output "paper.html" \
  [--style "modern|classic"]

檢查論文狀態:

uv run scripts/paper_manager.py check --arxiv-id "2301.12345"

列出你的論文:

uv run scripts/paper_manager.py list-my-papers

搜尋論文:

uv run scripts/paper_manager.py search --query "transformer attention"

YAML 中繼資料格式

將論文連結到模型或資料集時,需要正確的 YAML frontmatter:

模型卡範例:

---
language:
  - en
license: apache-2.0
tags:
  - text-generation
  - transformers
  - llm
library_name: transformers
---

# 模型名稱

此模型基於 [Our Paper](https://arxiv.org/abs/2301.12345) 中描述的方法。

## 引用

```bibtex
@article{doe2023paper,
  title={Your Paper Title},
  author={Doe, Jane and Smith, John},
  journal={arXiv preprint arXiv:2301.12345},
  year={2023}
}

**資料集卡範例:**
```yaml
---
language:
  - en
license: cc-by-4.0
task_categories:
  - text-generation
  - question-answering
size_categories:
  - 10K<n<100K
---

# 資料集名稱

資料集在 [Our Paper](https://arxiv.org/abs/2301.12345) 中介紹。

更多詳細資訊,請參閱[論文頁面](https://huggingface.co/papers/2301.12345)。

Hub 會自動從這些連結中提取 arXiv ID,並建立 arxiv:2301.12345 標籤。

整合範例

工作流程 1:發布新研究

# 1. 建立研究文章
uv run scripts/paper_manager.py create \
  --template "modern" \
  --title "Novel Fine-Tuning Approach" \
  --output "paper.md"

# 2. 編輯 paper.md 並加入你的內容

# 3. 提交到 arXiv(外部流程)
# 上傳到 arxiv.org,取得 arXiv ID

# 4. 在 Hugging Face 上索引
uv run scripts/paper_manager.py index --arxiv-id "2301.12345"

# 5. 連結到你的模型
uv run scripts/paper_manager.py link \
  --repo-id "your-username/your-model" \
  --repo-type "model" \
  --arxiv-id "2301.12345"

# 6. 聲明作者身份
uv run scripts/paper_manager.py claim \
  --arxiv-id "2301.12345" \
  --email "your.email@edu"

工作流程 2:連結現有論文

# 1. 檢查論文是否存在
uv run scripts/paper_manager.py check --arxiv-id "2301.12345"

# 2. 如有需要則索引
uv run scripts/paper_manager.py index --arxiv-id "2301.12345"

# 3. 連結到多個儲存庫
uv run scripts/paper_manager.py link \
  --repo-id "username/model-v1" \
  --repo-type "model" \
  --arxiv-id "2301.12345"

uv run scripts/paper_manager.py link \
  --repo-id "username/training-data" \
  --repo-type "dataset" \
  --arxiv-id "2301.12345"

uv run scripts/paper_manager.py link \
  --repo-id "username/demo-space" \
  --repo-type "space" \
  --arxiv-id "2301.12345"

工作流程 3:更新模型並加入論文參考文獻

# 1. 取得目前的 README
hf download username/model-name README.md

# 2. 新增論文連結
uv run scripts/paper_manager.py link \
  --repo-id "username/model-name" \
  --repo-type "model" \
  --arxiv-id "2301.12345" \
  --citation "Full citation for the paper"

# 腳本會:
# - 如果缺少 YAML 中繼資料則新增
# - 在 README 中插入 arXiv 連結
# - 新增格式化的引用
# - 保留現有內容

最佳實務

  1. 論文索引

    • 論文在 arXiv 上發布後立即索引
    • 在模型/資料集卡中包含完整的引用資訊
    • 在相關儲存庫中使用一致的論文參考文獻
  2. 中繼資料管理

    • 為所有模型/資料集卡新增 YAML frontmatter
    • 包含正確的授權資訊
    • 使用相關的任務類別和領域進行標記
  3. 作者身份

    • 在你列為作者的論文上聲明作者身份
    • 使用機構電子郵件地址進行驗證
    • 保持論文可見性設定更新
  4. 儲存庫連結

    • 將論文連結到所有相關的模型、資料集和 Spaces
    • 在 README 描述中包含論文背景
    • 新增 BibTeX 引用以便參考
  5. 研究文章

    • 在專案中一致地使用範本
    • 在論文中包含程式碼和資料連結
    • 產生適合網頁分享的 HTML 版本

進階用法

批次連結論文:

# 將多篇論文連結到一個儲存庫
for arxiv_id in "2301.12345" "2302.67890" "2303.11111"; do
  uv run scripts/paper_manager.py link \
    --repo-id "username/model-name" \
    --repo-type "model" \
    --arxiv-id "$arxiv_id"
done

提取論文資訊:

# 從 arXiv 取得論文中繼資料
uv run scripts/paper_manager.py info \
  --arxiv-id "2301.12345" \
  --format "json"

產生引用:

# 建立 BibTeX 引用
uv run scripts/paper_manager.py citation \
  --arxiv-id "2301.12345" \
  --format "bibtex"

驗證連結:

# 檢查儲存庫中的所有論文連結
uv run scripts/paper_manager.py validate \
  --repo-id "username/model-name" \
  --repo-type "model"

錯誤處理

  • 找不到論文:arXiv ID 不存在或尚未索引
  • 權限拒絕:HF_TOKEN 缺少儲存庫的寫入權限
  • 無效的 YAML:README frontmatter 中的中繼資料格式錯誤
  • 作者身份失敗:電子郵件與論文作者記錄不符
  • 已聲明:另一位使用者已聲明作者身份
  • 速率限制:短時間內發出太多 API 請求

疑難排解

問題:「在 Hugging Face 上找不到論文」

  • 解決方案:造訪 hf.co/papers/{arxiv-id} 以觸發索引

問題:「作者身份聲明未驗證」

  • 解決方案:等待管理員審查,或聯絡 HF 支援並提供證明

問題:「arXiv 標籤未出現」

  • 解決方案:確保 README 包含正確的 arXiv URL 格式

問題:「無法連結到儲存庫」

  • 解決方案:驗證 HF_TOKEN 具有寫入權限

問題:「範本渲染錯誤」

  • 解決方案:檢查 Markdown 語法和 YAML frontmatter 格式

資源和參考文獻

與 tfrere 的研究範本整合

此技能補充了 tfrere 的研究文章範本,提供:

  • 自動化論文索引工作流程
  • 儲存庫連結功能
  • 中繼資料管理工具
  • 引用產生工具

你可以使用 tfrere 的範本來撰寫,然後使用此技能在 Hugging Face Hub 上發布和連結論文。

常見模式

模式 1:新論文發布

# 撰寫 → 發布 → 索引 → 連結
uv run scripts/paper_manager.py create --template modern --output paper.md
# (提交到 arXiv)
uv run scripts/paper_manager.py index --arxiv-id "2301.12345"
uv run scripts/paper_manager.py link --repo-id "user/model" --arxiv-id "2301.12345"

模式 2:現有論文探索

# 搜尋 → 檢查 → 連結
uv run scripts/paper_manager.py search --query "transformers"
uv run scripts/paper_manager.py check --arxiv-id "2301.12345"
uv run scripts/paper_manager.py link --repo-id "user/model" --arxiv-id "2301.12345"

模式 3:作者作品集管理

# 聲明 → 驗證 → 組織
uv run scripts/paper_manager.py claim --arxiv-id "2301.12345"
uv run scripts/paper_manager.py list-my-papers
uv run scripts/paper_manager.py toggle-visibility --arxiv-id "2301.12345" --show true

API 整合

Python 腳本範例:

from scripts.paper_manager import PaperManager

pm = PaperManager(hf_token="your_token")

# 索引論文
pm.index_paper("2301.12345")

# 連結到模型
pm.link_paper(
    repo_id="username/model",
    repo_type="model",
    arxiv_id="2301.12345",
    citation="Full citation text"
)

# 檢查狀態
status = pm.check_paper("2301.12345")
print(status)

未來增強功能

未來版本規劃的功能:

  • 支援非 arXiv 論文(會議論文集、期刊)
  • 從 DOI 自動格式化引用
  • 論文比較和版本控制工具
  • 協作論文撰寫功能
  • 與 LaTeX 工作流程整合
  • 自動化圖表和表格提取
  • 論文指標和影響力追蹤