{"web_apps":[{"id":"portal-hub","name":"Datamerge","description":"统一呈现生产工作台、数据资产、Agent 工具与实时服务状态。","summary":"统一能力入口","category":"system","capabilities":["应用目录","实时状态","Manifest","MCP"],"type":"hub","url":"/","port":8090,"availability":"production"},{"id":"ppt-extractor","name":"PPT 内容提取","description":"将 PPTX 逐页转换为图像、结构化元数据、HTML 报告和可下载交付包。","summary":"PPTX → 图像 / JSON / HTML","category":"understand","capabilities":["逐页提取","JSON 元数据","HTML 报告","ZIP 交付"],"type":"fastapi","url":"/apps/ppt-extractor/","port":8000,"availability":"production"},{"id":"card-manager","name":"名片批量排版","description":"面向中英双语名片的批量编辑、版式预览与 PDF/PNG 导出。","summary":"名片批量编辑与导出","category":"deliver","capabilities":["中英双语","批量编辑","PDF","PNG"],"type":"static","url":"/apps/card-manager/","port":null,"availability":"production"},{"id":"ingredients-browser","name":"食材与地理","description":"只读预览全球食材（ing.*）与地理参考（place.*）：搜索、详情、营养 match_basis、place_ids 跳转。","summary":"版本化食材与地理知识库","category":"data","capabilities":["食材检索","地理关联","营养依据","版本化数据"],"type":"static","url":"/apps/ingredients/","port":null,"availability":"production"},{"id":"pdf-destructure","name":"PDF 全量解构","description":"逐页 Docling/OCR 与 Precision MinerU 全量 PDF 解构；私有 COS、无损分片、完整性审计、facts 与思维导图。","summary":"PDF → Markdown / Facts / 思维导图","category":"understand","capabilities":["MinerU Precision","无损分片","结构化 Markdown","完整性审计"],"type":"static","url":"/apps/pdf-destructure/","port":null,"availability":"production"},{"id":"image-ocr","name":"临床量表数据核验","description":"临床量表按连续两页组成一份，左侧正背面扫描件、右侧仅核验手写值与勾选项，支持密码协作编辑与全量导出。","summary":"管理员管理、项目密码访问的双页临床量表核验","category":"understand","capabilities":["双页病历","手写字段","勾选核验","项目密码","全量导出"],"type":"static","url":"/apps/image-ocr/","port":null,"availability":"production"},{"id":"image-to-html","name":"图片转可编辑 HTML","description":"将海报、简历和页面截图转换为绝对定位的可编辑 DOM 文本层，并提供背景重建、置信度标记与逐层视觉校验。","summary":"图片 → 可编辑 HTML / IR / 视觉差异","category":"deliver","capabilities":["文字层 OCR","原生 DOM 编辑","背景重建","SSIM 校验","离线 HTML"],"type":"fastapi-pipeline","url":"/apps/image-to-html/","port":null,"availability":"production"},{"id":"admin-console","name":"管理控制台","description":"管理员专用的访问密钥创建与撤销、账户、权限、调用历史和错误审计入口。","summary":"API Key、账户与调用审计","category":"system","capabilities":["API Key 治理","权限与归属","调用审计","账户管理"],"type":"static","url":"/apps/admin/","port":null,"availability":"production"},{"id":"md-preview","name":"品牌文档工作台","description":"基于 Pandoc 规范 AST 的通用文档工作台，支持健康 QA、办公/出版/标记/社交格式、私有历史和 MCP。","summary":"Markdown / 文本 → DOCX / XLSX","category":"deliver","capabilities":["DOCX","XLSX","品牌模板","Agent Judge","内容保真"],"type":"fastapi-worker","url":"/apps/md-preview/","port":null,"availability":"production"},{"id":"web-capture","name":"网页切割与社媒交付","description":"采集微信公众号单篇文章、公开历史页或经 Admin 扫码认证后的历史文章，并将网页转为经过 QA 的完整长图、公众号连续切图和小红书分卷图片包。","summary":"网页 → 长图 / 公众号 / 小红书","category":"collect","capabilities":["微信公众号文章采集","认证历史链接发现","完整长图","公众号切图","小红书分卷","视觉 QA"],"type":"fastapi-worker","url":"/apps/web-capture/","port":null,"availability":"production"},{"id":"docling-gui","name":"Docling Batch (desktop)","description":"Tk GUI or CLI: PPTX → Markdown via Docling.","summary":null,"category":null,"capabilities":[],"type":"desktop","url":null,"port":null,"availability":"local-only"},{"id":"workflow-dashboard","name":"工作流与能力蓝图","description":"PDF 解构流水线可视化 + Prompt/Taxonomy/Agent 系统文档","summary":"可视化生产流程与 Agent 逻辑","category":"system","capabilities":["Pipeline","Prompt","Taxonomy","Agent"],"type":"static","url":"/apps/workflows/","port":null,"availability":"production"},{"id":"legacy-next","name":"Next.js blog (legacy)","description":"Archived blog app under old/my-app/.","summary":null,"category":null,"capabilities":[],"type":"nextjs","url":null,"port":3000,"availability":"legacy"}],"skills":[{"id":"paper-acquisition","name":"paper-acquisition","description":"Agent entry for PDFs and AOA collection; routes to manifest and know-how.","path":".cursor/skills/paper-acquisition/SKILL.md"},{"id":"paper-fetch","name":"paper-fetch","description":"Download PDF by DOI/title; OA chain + Sci-Hub fallback.","path":".cursor/skills/paper-fetch/SKILL.md"},{"id":"webpage-to-social-images","name":"webpage-to-social-images","description":"Preview, capture, validate, slice, name, upload, and return verified social-image packages for public H5 pages.","path":".cursor/skills/webpage-to-social-images/SKILL.md"},{"id":"anysearch","name":"anysearch","description":"AnySearch REST/MCP web+vertical search and URL extract for ingest discovery.","path":".cursor/skills/anysearch/SKILL.md"},{"id":"ingredient-database","name":"ingredient-database","description":"Global+regional ingredient DB with Places links, releases, portal/MCP APIs.","path":".cursor/skills/ingredient-database/SKILL.md"},{"id":"mineru-api","name":"mineru-api","description":"Official MinerU Precision VLM parsing for PDFs and document images with auditable raw artifacts.","path":".cursor/skills/mineru-api/SKILL.md"}],"mcp_tools":["get_manifest","list_capabilities","list_apps_status","paper_collection_status","get_skill","get_knowhow","ocr_list_providers","ocr_run_high_accuracy","ocr_run_status","pdf_mineru_capabilities","pdf_mineru_create_upload","pdf_mineru_submit","pdf_mineru_job_status","pdf_mineru_chunks","pdf_mineru_artifacts","pdf_mineru_retry","pdf_mineru_cancel","image_html_capabilities","image_html_list_documents","image_html_get_document","image_html_reprocess","image_html_export","conversion_capabilities","conversion_list_formats","conversion_list_input_formats","conversion_preflight","conversion_history","conversion_delete_job","conversion_list_themes","conversion_validate","conversion_upload_asset","conversion_upload_source","conversion_submit","conversion_job_status","conversion_retry","conversion_import_docx","conversion_import_status","conversion_assist","conversion_generate_illustration","conversion_illustration_status","conversion_list_brands","conversion_list_workflows","conversion_list_templates","conversion_judge","conversion_agent_run","conversion_convert","conversion_docforge_inspect","conversion_docforge_run","brand_sync_status","brand_sync_now","pdf_destructure_list_jobs","pdf_destructure_job_status","pdf_destructure_sync","pdf_destructure_start","pdf_destructure_search","pdf_destructure_export","workflow_pdf_destructure_spec","ppt_extractor_status","web_capture_list_jobs","web_capture_get_artifacts","web_capture_create_wechat_draft","web_capture_capabilities","web_capture_submit","web_capture_job_status","web_capture_retry","ingredient_status","ingredient_search","ingredient_get","ingredient_export","ingredient_schema","place_status","place_search","place_get"],"script_groups":["docling","ocr","ppt","papers","ingredients","dev","data_ingest"],"scripts":[{"id":"docling","count":4,"entries":[{"id":"pdf-destructure","description":"PDF 逐页解构 → 内容地图（Docling+OCR+VLM）"},{"id":"pdf-destructure-sh","description":"Shell wrapper for pdf_destructure workflow"},{"id":"docling-batch","description":"Batch convert PPTX → MD"},{"id":"merge-docling-md","description":"Merge docling_out/*.md → 全部文档合并.md"}]},{"id":"ocr","count":4,"entries":[{"id":"firered-ocr-install","description":"Install pinned FireRed-OCR source, MPS runtime, and model outside Git"},{"id":"firered-ocr-worker","description":"Local-only experimental Apple MPS FireRed-OCR worker"},{"id":"mineru-api","description":"Prioritized MinerU Precision VLM API; full-document jobs explicitly forbid Agent fallback"},{"id":"mineru-full-pipeline","description":"Lossless PDF chunking, render-hash verification, raw-block assembly, assets, coverage, facts, and mind maps"}]},{"id":"ppt","count":1,"entries":[{"id":"ppt-to-excel","description":"PPTX → Excel via python-pptx"}]},{"id":"papers","count":5,"entries":[{"id":"paper-run-download","description":"OA/title batch download"},{"id":"paper-scihub","description":"Paywalled DOIs via Sci-Hub (Referer fix)"},{"id":"paper-fetch-missing","description":"Abstracts + PDF retry for gaps (refs 6, 18, 31)"},{"id":"paper-rename","description":"Prefix PDFs 01_…32_"},{"id":"paper-number","description":"Copy to pdfs/numbered/RefNN_…"}]},{"id":"ingredients","count":4,"entries":[{"id":"ingredients-extract","description":"Extract/merge Hubei corpus hits into seed TSV"},{"id":"ingredients-enrich","description":"Enrich via Wikidata + USDA FDC + Open Food Facts (cached)"},{"id":"ingredients-release","description":"Validate schemas and write immutable JSONL release"},{"id":"ingredients-sqlite","description":"Build versioned SQLite + FTS5 for portal API"}]},{"id":"dev","count":2,"entries":[{"id":"dev-up","description":"Start portal :8090 + PPT extractor :8000"},{"id":"frontcap","description":"Local macOS CLI: hotkey start/stop frontmost-app content video, save folder + notification"}]},{"id":"data_ingest","count":5,"entries":[{"id":"data-ingest-cli","description":"Orchestrator: search/places/ingredients pipelines"},{"id":"anysearch-cli","description":"AnySearch REST search CLI"},{"id":"places-release","description":"Build places JSONL release"},{"id":"places-sqlite","description":"Build places SQLite+FTS"},{"id":"ingredients-migrate-1-1","description":"Migrate hb.* 1.0.0 → ing.* 1.1.0"}]}],"data_stores":[{"id":"ppt-jobs","type":"filesystem","description":"Per-job extraction output (in-memory job store; JSON artifacts per job)","path":"ppt_extractor_webapp/data/jobs/"},{"id":"pdf-destructure-jobs","type":"filesystem","description":"PDF destructure job output (pages, content_map, cache)","path":"2process/pdf_destructure/jobs/"},{"id":"pdf-mineru-jobs","type":"postgresql+private-cos","description":"Owned full-document MinerU jobs, chunks, events, artifacts, original PDFs, raw ZIPs, structured outputs, and delivery bundles","path":"pdf-destructure/YYYY/MM/DD/{job_id}/"},{"id":"docling-output","type":"filesystem","description":"Docling Markdown output","path":"2process/docling_out/"},{"id":"docling-source","type":"filesystem","description":"Source PPTX for Docling batch","path":"2process/ppt/"},{"id":"aoa-papers","type":"filesystem","description":"AOA ionophore reference PDFs/abstracts (01_–32_)","path":"papers/aoa-ionophore/pdfs/"},{"id":"casino-dataset","type":"csv","description":"Macau casino normalized CSV/XLSX (not linked to PPT/papers pipeline)","path":"data-set/"},{"id":"web-capture-jobs","type":"sqlite+cos","description":"Capture job state locally; verified artifacts in private COS under web-captures/YYYY/MM/DD/{job_id}/","path":"/data/web-capture/jobs.sqlite3"},{"id":"global-ingredients","type":"sqlite+jsonl","description":"Global ingredient DB (ing.* from 1.1.0; hb.* frozen at 1.0.0) + CN-HB corpus; JSONL releases + portal/data/ingredients/*.sqlite3; API /api/ingredients/*","path":"datasets/ingredients/"},{"id":"places","type":"sqlite+jsonl","description":"Geography reference (ISO/ADM/locality) linked from ingredient origin.place_ids","path":"datasets/places/"}],"knowhow":[{"id":"project-rules","topic":"PPT extractor Route A contract","path":"cursor_project_rules/README.md"},{"id":"paper-acquisition","topic":"Paper download skills, Sci-Hub, MCP usage","path":"cursor_project_rules/paper-acquisition-knowhow.md"},{"id":"portal","topic":"This portal — agents and humans","path":"cursor_project_rules/portal.md"},{"id":"pdf-destructure","topic":"PDF destructure workflow — architecture, prompts, reuse","path":"2process/pdf_destructure/SYSTEM.md"},{"id":"implementation-plan","topic":"Feature implementation log","path":"implementation-plan.mdc"},{"id":"ingredient-database","topic":"Hubei ingredient DB schema, API, versioning, licenses","path":"cursor_project_rules/ingredient-database.md"},{"id":"data-ingest","topic":"Data scrape/build project for datasets/*","path":"cursor_project_rules/data-ingest.md"},{"id":"search-apis","topic":"AnySearch and other search/data APIs","path":"cursor_project_rules/search-apis.md"},{"id":"docx-conversion","topic":"MD→DOCX fail-closed quarantine corpus and case intake","path":"cursor_project_rules/docx-conversion.md"}]}