SSD Nodes Learn 🎉 VPS $5.50/மாதம் முதல்

தொழில்நுட்பப் புத்தகங்களை ஏஜென்ட் திறனாக மாற்றுவது எப்படி?

PDF, EPUB அல்லது ஆவணங்களை உங்கள் கோடிங் ஏஜென்ட் பயன்படுத்தும் திறனாக மாற்றும் முறை இதோ. டோக்கன் பட்ஜெட், ஹெட்லெஸ் ரன்கள் மற்றும் லைசென்சிங் குறித்த முழுமையான வழிகாட்டி இங்கே உள்ளது.

தொழில்நுட்பப் புத்தகத்தை ஏஜென்ட் திறனாக (agent skill) மாற்றுதல்: இதன் பயன்கள்

ஒரு தொழில்நுட்பப் புத்தகத்தை ஏஜென்ட் திறனாக மாற்ற, நீங்கள் ஒரு PDF, EPUB, DOCX கோப்பு அல்லது உங்களிடம் உள்ள ஆவணங்கள் அடங்கிய கோப்புறையை (folder) ஒரு converter-க்கு உள்ளீடாக வழங்க வேண்டும். இது ஒரு திறன் கோப்பகத்தை (skill directory) உருவாக்கும்: பெயரிடப்பட்ட கட்டமைப்புகள் மற்றும் அத்தியாயங்களின் குறியீட்டைக் கொண்ட ஒரு முதன்மைக் கோப்பு, மற்றும் உங்கள் கேள்விக்குத் தேவைப்படும்போது மட்டும் ஏஜென்ட் வாசிக்கும் வகையில் ஒவ்வொரு அத்தியாயத்திற்கும் ஒரு தனித்தனி கோப்பு. முழுப் புத்தகமும் context window-க்குள் நுழையாது; குறியீடு (index) மட்டுமே நுழையும்.

இது ஏஜென்ட் திறனை புதிதாக உருவாக்குதல் என்பதற்கு நேர்மாறான பணியாகும்; அங்கு உங்களுக்கு ஏற்கனவே தெரிந்த ஒரு செயல்முறையை நீங்கள் குறியீடாக மாற்றுகிறீர்கள். இங்கே அறிவு ஏற்கனவே உள்ளது, ஆனால் அதை யாரும் அணுக முடியாது: உதாரணமாக, 800 பக்கங்கள் கொண்ட விற்பனையாளரின் PDF அல்லது அதை எழுதியவர் சென்ற பிறகு திறக்கப்படாத ஒரு கையேடு. இந்த வேலை என்பது தரவைச் சுருக்குவதும் (compression) குறியீட்டுப்படுத்துவதும் (indexing) ஆகும். 'திறன்' (skill) என்ற சொல் உங்களுக்குப் புதியது என்றால், முதலில் ஏஜென்ட் திறன் என்றால் என்ன என்பதைப் படிக்கவும்.

இங்கே பயன்படுத்தப்படும் converter book-to-skill ஆகும். இது MIT உரிமம் பெற்ற ஒரு திறன், இது உங்கள் சொந்த கணினியில் இயங்குகிறது. ஆகஸ்ட் 2026 நிலவரப்படி இதன் தற்போதைய tag v1.4.0 ஆகும். இது உருவாக்கும் கட்டமைப்பு, கருவியை விட முக்கியமானது. FAQ பகுதிக்கு முந்தைய கடைசிப் பகுதியில், அதே கட்டமைப்பை நீங்களே எப்படி உருவாக்குவது என்பது விளக்கப்பட்டுள்ளது.

Token budget ஏன் முழு வடிவமைப்பாக உள்ளது

ஒரு புத்தகத்தை context window-வில் பதிவேற்றினால், அது தேவைப்படும் ஒவ்வொரு உரையாடலிலும் அதன் முழு அளவிற்கான செலவை ஏற்படுத்துகிறது. ஒரு skill அதன் entry file-ஐ ஒருமுறை மட்டுமே எடுத்துக்கொள்கிறது, அதன்பின் கேள்விக்குத் தேவையான அத்தியாயங்களை மட்டுமே பயன்படுத்துகிறது. ஒவ்வொரு கோப்பிற்கும் ஒரு குறிப்பிட்ட budget-ஐ project ஆவணப்படுத்துகிறது.

ChartDocumented token budget per generated file, book-to-skill v1.4.0
The data behind this chart
[
  {
    "label": "SKILL.md entry file",
    "tokens": "4,000"
  },
  {
    "label": "One chapter file",
    "tokens": "1,000"
  },
  {
    "label": "glossary.md",
    "tokens": "1,500"
  },
  {
    "label": "patterns.md",
    "tokens": "2,000"
  },
  {
    "label": "cheatsheet.md",
    "tokens": "1,000"
  }
]

Entry file-ஆன SKILL.md, 4,000 tokens-க்குள் இருக்க வேண்டும் மற்றும் அது குறிப்பிட்ட frameworks மற்றும் அத்தியாயங்களின் குறியீட்டை (chapter index) கொண்டிருக்க வேண்டும். ஒவ்வொரு அத்தியாயக் கோப்பும் சுமார் 1,000 tokens அளவுடையது; அது தேவைப்படும் வரை disk-லேயே இருக்கும். துணைக்கோப்புகளும் இதே போன்றவையே: glossary.md-க்கு 1,500 tokens, patterns.md-க்கு 2,000 tokens, மற்றும் cheatsheet.md-க்கு 1,000 tokens.

இந்த வரவுசெலவுத் திட்டங்கள் (budgets), Claude Code எவ்வாறு context-ஐப் பயன்படுத்துகிறது என்பதோடு ஒத்துப்போகின்றன. ஒரு skill-ன் description, skill பட்டியலில் இருப்பதால், அந்த skill இருப்பதை model அறிந்துகொள்கிறது. ஒரு skill-ஐ அழைக்கும்போது அதன் உள்ளடக்கம் (body) ஏற்றப்படும்; அது ஏற்றப்பட்ட பிறகு, அந்த session முடியும் வரை context-ல் இருக்கும். எனவே, entry file-ல் உள்ள ஒவ்வொரு வரியும் மீண்டும் மீண்டும் செலவை ஏற்படுத்தும். துணைக்கோப்புகள் agent-ஆல் வாசிக்கப்படும்போது மட்டுமே ஏற்றப்படும், இதனால்தான் அத்தியாயம் வாரியான கோப்புகள் சிக்கனமானவை.

Entry file-ன் இந்த எண்ணிக்கைக்குப் பின்னால் ஒரு கடுமையான வரம்பு உள்ளது. Auto-compaction ஒரு நீண்ட உரையாடலைச் சுருக்கும்போது, Claude Code ஒவ்வொரு skill-ன் சமீபத்திய அழைப்பையும் சுருக்கத்திற்குப் பிறகு மீண்டும் இணைக்கும். ஒவ்வொரு skill-ன் முதல் 5,000 tokens-ஐ அது தக்கவைக்கும்; மீண்டும் இணைக்கப்பட்ட அனைத்து skill-களுக்கும் சேர்த்து மொத்தம் 25,000 tokens என்ற வரம்பிற்குள் இது அமையும். 5,000 tokens-க்குள் இருக்கும் ஒரு entry file, compaction-க்குப் பிறகும் முழுமையாக இருக்கும். 20,000 tokens கொண்ட ஒரு entry file-ன் முதல் கால் பகுதி மட்டுமே திரும்ப வரும்; எந்த மூன்று கால் பகுதிகள் நீக்கப்பட்டன என்ற தகவல் கிடைக்காது.

இதுவே progressive disclosure ஆகும்: எப்போதும் அதன் செலவிற்குத் தகுதியான ஒரு சிறிய குறியீடு (index), மற்றும் agent வேண்டுமென்றே திறக்கும் ஒரு கதவிற்குப் பின்னால் இருக்கும் பெரும்பான்மையான தகவல்கள். Claude Code அதன் context window-வை எவ்வாறு நிர்வகிக்கிறது என்பது மீதமுள்ள கணக்கீடுகளை விளக்குகிறது.

உங்கள் VPS-ல் converter-ஐ நிறுவுதல், ஒரு குறிப்பிட்ட release-க்கு pinned செய்தல்

இந்த skill ஒரு git repository ஆகும். நீங்கள் பயன்படுத்தும் agent-ன் skills directory-க்குள் இதை clone செய்யவும். அந்த directory-ன் பெயரே slash command-ஆக மாறும், எனவே clone செய்யும் path-ஐ கவனமாகத் தேர்ந்தெடுக்கவும்.

git clone --depth 1 --branch v1.4.0 \
  https://github.com/virgiliojr94/book-to-skill.git \
  ~/.claude/skills/book-to-skill

--branch ஒரு tag-ஐ ஏற்கும், எனவே இது v1.4.0-ஐ மட்டும் சரிபார்க்கும், அதற்குப் பிந்தைய எதையும் எடுக்காது. இதை pin செய்யவும், ஏனெனில் ஒரு skill என்பது உங்கள் agent பின்பற்றும் அறிவுறுத்தல்களின் தொகுப்பாகும்; அந்த அறிவுறுத்தல்களில் நீங்கள் சரிபார்க்காத மாற்றம் ஏற்பட்டால், அது உங்கள் server-ல் இயங்கும் செயலில் மாற்றத்தை ஏற்படுத்தும். GitHub Copilot CLI இதற்குப் பதிலாக ~/.copilot/skills/-ஐ வாசிக்கும், Amp ~/.agents/skills/-ஐ வாசிக்கும்.

ஒரே வரியில் நிறுவும் வசதியும் உள்ளது, npx skills add virgiliojr94/book-to-skill, இது தற்போதுள்ள சமீபத்திய பதிப்பைப் பெற்றுத் தரும். கருவியை முயற்சித்துப் பார்க்க இதைப் பயன்படுத்தவும். நீங்கள் மீண்டும் மீண்டும் இயக்கும் எதற்கும் pinned clone-ஐப் பயன்படுத்தவும்.

இப்போது அந்த box-ல் எந்தெந்த extractors உள்ளன என்பதை உறுதிப்படுத்தவும்:

cd ~/.claude/skills/book-to-skill
python3 scripts/extract.py --check

--check எந்தெந்த extractors நிறுவப்பட்டுள்ளன என்பதைத் தெரிவிக்கும், மேலும் விடுபட்ட ஒவ்வொன்றிற்கும் தேவையான install command-ஐ அச்சிடும். இந்த package-க்கு Python 3.9 அல்லது அதற்குப் பிந்தைய பதிப்பு தேவை.

clone செய்த பிறகு autocomplete-ல் /book-to-skill தோன்றவில்லை என்றால், உங்கள் agent-ஐ restart செய்யவும். Claude Code அமர்வு தொடங்கியபோது இருந்த skill directory-களை மட்டுமே கவனிக்கும், எனவே இரண்டு நிமிடங்களுக்கு முன்பு நீங்கள் உருவாக்கிய ~/.claude/skills/ இன்னும் கண்காணிக்கப்படாது.

உங்களுக்கு உண்மையில் எந்தெந்த extractors தேவை?

Python-ஐத் தவிர வேறு எதுவும் தேவையில்லை, ஏனெனில் ஒவ்வொரு வடிவத்திற்கும் standard-library-ல் ஒரு மாற்று வழி உள்ளது. அந்த மாற்று வழிகள் தரம் குறைந்தவை, மேலும் சிறிய server-களில் உங்களுக்குத் தேவையில்லாத extractors-ஐ நிறுவுவது நேரத்தை வீணடிக்கும்.

  • pdftotext, இது poppler-utils தொகுப்பில் உள்ளது, அதிக உரை கொண்ட PDF-களைக் கையாளும் மற்றும் மிக வேகமாகச் செயல்படும். இதை sudo apt install poppler-utils மூலம் நிறுவவும்.
  • pypdf மற்றும் pdfminer.six ஆகியவை PDF-களுக்கான Python மாற்று வழிகள்.
  • docling என்பது தொழில்நுட்ப PDF-களுக்கானது, இதில் அட்டவணைகள் மற்றும் குறியீட்டுப் பட்டியல்கள் முக்கியம். ஒரு பக்கத்திற்கு சுமார் 1.5 வினாடிகள் எடுக்கும் என இந்தத் திட்டம் மதிப்பிடுகிறது.
  • ebooklib மற்றும் beautifulsoup4 ஆகியவை EPUB-ஐச் சரியாக வாசிக்கும். இவை இல்லையெனில், இந்த கருவி stdlib zipfile reader-க்கு மாறிவிடும்.
  • python-docx DOCX-ஐயும், striprtf RTF-ஐயும் வாசிக்கும்.
  • MOBI மற்றும் AZW கோப்புகளுக்கு Calibre-ன் ebook-convert தேவை.
  • ocrmypdf என்பது ஸ்கேன் செய்யப்பட்ட புத்தகங்களில் OCR (optical character recognition) செய்யப் பயன்படுகிறது, இதில் உரை அடுக்கு (text layer) இருக்காது.

Ubuntu 24.04-ல் ஒரு சாதாரண pip3 install pypdf கட்டளை இதனுடன் நின்றுவிடும்:

error: externally-managed-environment

இது pip பழுதடைந்ததைக் குறிக்காது. Ubuntu மற்றும் Debian-ல் system Python-ஐ apt நிர்வகிப்பதால், அதில் எதையும் எழுத pip அனுமதிப்பதில்லை. இதற்கு இரண்டு தீர்வுகள் உள்ளன. sudo apt install poppler-utils ஒரு binary-ஐ நிறுவுகிறது, இதற்கு pip தேவையில்லை. pdftotext பெரும்பாலான உரை சார்ந்த PDF-களைத் தனியாகவே கையாளும். Python extractors-க்கு, ஒரு virtual environment-ஐ உருவாக்கி, அதிலிருந்து உங்கள் agent-ஐத் தொடங்கவும். அப்போதுதான் skill அழைக்கும் python3, தேவையான தொகுப்புகளைக் கொண்ட interpreter-ஆக இருக்கும்.

python3 -m venv ~/.venvs/book-to-skill
source ~/.venvs/book-to-skill/bin/activate
pip install "$HOME/.claude/skills/book-to-skill[pdf,epub,docx]"
claude

இந்த repository pdf, epub, docx, rtf, technical மற்றும் all ஆகிய extras-ஐக் குறிப்பிடுகிறது, இதில் technical என்பது docling ஆகும். இந்தத் திட்டத்தின் நிறுவல் பக்கத்தில் pip install "book-to-skill[pdf,epub,docx]"-ம் காட்டப்பட்டுள்ளது, ஆனால் ஆகஸ்ட் 2026 நிலவரப்படி அந்தப் பெயர் PyPI-ல் வெளியிடப்படவில்லை, எனவே மேலே குறிப்பிட்டபடி உங்கள் சொந்த checkout-லிருந்து நிறுவவும்.

ஒரு புத்தகத்திற்குத் தேவைப்படும் வரை docling-ஐத் தவிர்க்கவும். இது ஒரு machine learning stack-ஐ நிறுவும், எனவே சிறிய திட்டங்களில் (small plan) இதை நிறுவும் முன் வட்டில் போதிய இடம் உள்ளதா எனச் சரிபார்க்கவும்.

ஆவணங்கள் அடங்கிய கோப்புறையில் இயக்குதல், headless முறை உட்பட

இந்தக் கட்டளை ஒரு கோப்பு, கோப்புறை, மேற்கோள் காட்டப்பட்ட glob, அல்லது பல பாதைகளை ஒரே நேரத்தில் எடுத்துக்கொள்ளும்; அதைத் தொடர்ந்து விருப்பத்தேர்வாக ஒரு skill பெயரை வழங்கலாம். ஒரு கோப்பகத்தில் நீங்கள் வைக்கக்கூடிய அனைத்தும் இதில் வேலை செய்யும், RFC தொகுப்புகள் (இணைய நெறிமுறைகளை வரையறுக்கும் ஆவணங்கள்) உட்பட.

/book-to-skill ~/library/platform-docs/ platform-handbook
/book-to-skill "~/books/*.epub" my-library
/book-to-skill ~/papers/paper1.pdf ~/notes/export.txt unified-research

Glob-ஐ மேற்கோள் குறிகளுக்குள் (quote) இடவும், அப்போதுதான் skill அதைப் பார்ப்பதற்கு முன்பே உங்கள் shell அதை விரிவாக்காது. ஏற்கனவே உள்ள ஒரு skill கோப்பகத்தை இந்தக் கட்டளைக்குக் குறிப்பிட்டால், அது இரண்டாவது skill-ஐ உருவாக்காமல், புதிய ஆதாரங்களை அந்த skill-உடன் இணைக்கும்.

ஒரு interactive run உங்களை கேள்விகளைக் கேட்கும். உள்ளடக்கமானது தொழில்நுட்பம் சார்ந்ததா அல்லது உரை அதிகம் கொண்டதா என்பதைப் பொறுத்து extractor தீர்மானிக்கப்படும். உங்களுக்கு reference ஆழம் வேண்டுமா அல்லது study ஆழம் வேண்டுமா என்பதைப் பொறுத்து, ஒவ்வொரு அத்தியாயத்திற்கான budget தீர்மானிக்கப்படும். அந்த skill-க்கு என்ன பெயர் வைக்க வேண்டும், அது எந்த skill root-ல் இருக்க வேண்டும் என்பனவும் கேட்கப்படும். உருவாக்கத்திற்கு முன்பாக இது token மற்றும் நேர மதிப்பீட்டைக் காட்டி, உங்கள் உறுதிப்படுத்தலுக்காகக் காத்திருக்கும்.

Headless run-ல் இந்தக் கேள்விகளுக்குப் பதிலளிக்க யாரும் இருக்க மாட்டார்கள். பயனர் அழைக்கக்கூடிய skills claude -p-ல் வேலை செய்யும்: prompt string-ல் slash கட்டளையை இடவும், run தொடங்குவதற்கு முன்பே Claude Code அதை விரிவாக்கும். எனவே, அதே prompt-ல் கேள்விகளுக்கான பதில்களையும் வழங்கவும்.

claude -p "/book-to-skill ~/library/platform-docs/ platform-handbook
The sources are technical. Use reference depth. Write the skill to
~/.claude/skills/. Do not publish it to GitHub. Proceed without asking me." \
  --allowedTools "Bash,Read,Write,Edit"

--allowedTools, run-க்குத் தேவையான கருவிகளை முன்கூட்டியே அங்கீகரிக்கும், ஏனெனில் terminal இணைக்கப்படாத அனுமதி கோரும் prompt-ல் run ஒருபோதும் முடிவடையாது. --output-format json-ஐச் சேர்ப்பது total_cost_usd-ஐ முடிவில் காட்டும், இது உங்கள் கட்டணத்தைக் காட்டிலும் client-side மதிப்பீடாகும்.

Extraction, எந்தவொரு மாதிரியும் (model) படிப்பதற்கு முன்பாக, ஒவ்வொரு ஆதாரத்தையும் /tmp-ன் கீழ் உள்ள தற்காலிக பணி கோப்பகத்தில் ஒருங்கிணைக்கும்; run-ன் கடைசி கட்டத்தில் அந்த கோப்பகம் நீக்கப்படும். பிரித்தெடுக்கத் தவறிய ஒரு ஆதாரம் தவிர்க்கப்படும், இதனால் batch செயல்முறை தொடரும்; அதாவது நீங்கள் வழங்கிய கோப்புகளைக் காட்டிலும் குறைவான கோப்புகளைப் படித்துவிட்டு ஒரு run வெற்றியைப் பதிவு செய்யலாம். இறுதி அறிக்கையில் உள்ள கோப்புப் பட்டியலை, நீங்கள் கோப்புறையில் வழங்கியவற்றுடன் ஒப்பிட்டுப் பார்க்கவும். விடுபட்ட அத்தியாயம் என்பது பொதுவாக விடுபட்ட ஆதாரத்தைக் குறிக்கும்.

ஒரு agent-க்கு வழங்க நீங்கள் தயங்காத server-ல் இந்த run-ஐ இயக்கவும். Claude Code-ஐ VPS-ல் பாதுகாப்பாக இயக்குதல் என்பது இது தொடர்பான அனுமதிகளை விளக்குகிறது.

வெளியீடு எங்கு செல்லும், உங்கள் கோடிங் ஏஜென்ட் அதை எப்படிக் கண்டறியும்

உருவாக்கப்பட்ட திறன் (skill) ஒரு திறன் ரூட் (skills root) கோப்பகத்தில் சேமிக்கப்படும். அதில் இரண்டு முக்கியமானவை.

  • ~/.claude/skills/<skill-name>/ என்பது தனிப்பட்ட பயன்பாட்டிற்கானது, அந்த கணினியில் உள்ள அனைத்து புராஜெக்டுகளிலும் இதைப் பயன்படுத்தலாம்.
  • .claude/skills/<skill-name>/ என்பது ஒரு ரெபாசிட்டரிக்குள் (repository) இருக்கும், அது அந்த ரெபாசிட்டரியுடன் சேர்ந்து பயணிக்கும்.

இவற்றில் எதனுள்ளும் நீங்கள் SKILL.md-ஐப் பெறுவீர்கள். இது ஒரு chapters/ கோப்பகம், இதில் ஒவ்வொரு அத்தியாயத்திற்கும் ஒரு கோப்பு மற்றும் அதற்கான துணை கோப்புகள் இருக்கும். கோப்பகத்தின் பெயரே கமாண்ட் (command) ஆகும். எனவே ~/.claude/skills/platform-handbook/ என்பது உங்களுக்கு /platform-handbook-ஐத் தரும். அதைத் தொடர்ந்து நீங்கள் ஒரு தலைப்பையோ அல்லது சாதாரண கேள்வியையோ உள்ளிடலாம்.

வசதியை விட உரிமத்தின் (licensing) அடிப்படையில் ரூட்டைத் தேர்வு செய்யவும். நீங்கள் வாங்கிய புத்தகத்திலிருந்து உருவாக்கப்பட்ட திறன் உங்கள் தனிப்பட்ட கோப்பகத்தில் இருக்க வேண்டும். உங்கள் குழு எழுதிய ஆவணங்களிலிருந்து உருவாக்கப்பட்ட திறன் ரெபாசிட்டரியில் இருக்க வேண்டும். இது ஒரே திறனை பல ரெபாசிட்டரிகளில் பகிர்ந்துகொள்ளுதல் என்ற அடுத்த சிக்கலைத் தீர்க்க வழிவகுக்கும்.

நீங்கள் சேர்க்கும் ஒவ்வொரு திறனுடனும் ஒரு செலவு அதிகரிக்கிறது. ஒவ்வொரு திறனின் விளக்கமும் திறன் பட்டியலில் இருக்கும், அப்போதுதான் மாடல் (model) அதைப் பயன்படுத்த வேண்டுமா என்று முடிவு செய்ய முடியும். ஒருங்கிணைந்த விளக்க உரை ஒரு உள்ளீட்டிற்கு 1,536 எழுத்துகள் வரை சுருக்கப்படும், மேலும் ஒட்டுமொத்த பட்டியலுக்கும் ஒரு வரவு செலவுத் திட்டம் (budget) உள்ளது. பத்து புத்தகத் திறன்கள் என்றால், பத்து விளக்கங்கள் அதற்காகப் போட்டியிடும். நீங்கள் எப்போதும் பெயரைக் குறிப்பிட்டு அழைக்கும் திறன்களுக்கு, உருவாக்கப்பட்ட ஃப்ரண்ட்மேட்டரில் (frontmatter) ஒரு வரியைச் சேர்க்கவும்:

---
name: platform-handbook
description: Frameworks and chapter index from the internal platform handbook.
disable-model-invocation: true
---

disable-model-invocation: true மூலம் விளக்கம் சூழலில் (context) இருந்து முற்றிலும் நீக்கப்படும், மேலும் நீங்கள் /platform-handbook என்று தட்டச்சு செய்யும்போது அந்தத் திறன் முழுமையாக லோட் (load) ஆகும். நீங்கள் தானியங்கி கண்டறிதலை (automatic discovery) விட்டுக்கொடுத்துவிட்டு, அமைதியான சூழல் விண்டோவைப் (context window) பெறுவீர்கள்.

உரிமம்: MIT என்பது மாற்றியை (converter) மட்டுமே குறிக்கும், புத்தகத்தை அல்ல

இதில் கவனமாக இருக்கவும், ஏனெனில் இங்கு ஏற்படும் தோல்வி தொழில்நுட்ப ரீதியானது அல்ல.

  • MIT உரிமம் மாற்றியின் நிரலையும் (code) அதன் திறன் வரையறையையும் (skill definition) மட்டுமே உள்ளடக்கியது. நீங்கள் அதற்கு வழங்கும் ஆவணத்தைப் பற்றி அது எதையும் குறிப்பிடவில்லை.
  • நீங்கள் வாங்கிய ஒரு புத்தகத்தை, உங்கள் கட்டுப்பாட்டில் உள்ள வன்பொருளில் (hardware) இந்த மாற்றியைப் பயன்படுத்திச் செயலாக்குவது, உங்கள் சொந்தப் பிரதியிலிருந்து குறிப்புகளை எடுப்பதாகவே அமையும்.
  • அதன் வெளியீட்டைப் பதிப்பிப்பது விநியோகமாகக் (distribution) கருதப்படுகிறது. இந்த கருவிக்கான MIT உரிமம், வேறொருவரின் புத்தகத்திலிருந்து பெறப்பட்ட எதையும் விநியோகிக்கும் உரிமையை உங்களுக்கு வழங்காது.
  • இதன் வெளியீடு ஒரு வழித்தோன்றல் படைப்பாகும் (derivative work). கட்டமைப்புகள் மற்றும் அத்தியாயங்களின் சாராம்சங்கள் இன்னும் மூலப் புத்தகத்தின் வடிவத்திலேயே இருப்பதால், அந்த வழித்தோன்றல் படைப்பு மூலப் புத்தகத்தின் பதிப்புரிமையின் (copyright) கீழ் வரும்.
  • நீங்கள் மறுவிநியோகம் செய்ய முடியாத பொருள்களிலிருந்து உருவாக்கப்பட்ட ஒரு திறன் (skill), அதை உருவாக்கிய கணினியிலேயே இருக்க வேண்டும். பொது களஞ்சியத்திலோ (public repository) அல்லது பகிரப்பட்ட குழு சந்தையிலோ (shared team marketplace) இருக்கக்கூடாது.
  • மூலப்பொருள் உங்களுடையதாக இருக்கும்போதோ அல்லது வெளிப்படையான உரிமம் பெற்றிருக்கும்போதோ மட்டுமே பதிப்பிக்கவும்: உங்கள் குழு எழுதிய ஆவணங்கள் அல்லது மறுவிநியோகத்தை அனுமதிக்கும் விதிமுறைகளைக் கொண்ட தரநிலைகள் போன்றவை இதில் அடங்கும்.

இந்தக் கருவி இதற்கேற்பவே கட்டமைக்கப்பட்டுள்ளது. இது எந்தப் புத்தக உள்ளடக்கத்தையும் கொண்டிருக்கவில்லை, பிரித்தெடுத்தல் (extraction) உள்ளூர் அளவில் மட்டுமே நடக்கும், மேலும் அதன் பதிப்பித்தல் படிநிலை (publish step), களஞ்சியத்தின் தெரிவுநிலை (repository visibility) குறித்து ஒரு தனி கேள்வியைக் கேட்கிறது. அது தானாக எதையும் தீர்மானிக்காமல், public அல்லது private ஆகிய சொற்களை மட்டுமே ஏற்கும். அந்தத் தூண்டுதலை (prompt) ஒரு உரிம முடிவாகக் கருதவும், ஏனெனில் அதுவே அதன் நோக்கம்.

உள்நாட்டு கையேடுகளில் (internal handbooks) இரண்டாவது சிக்கல் உள்ளது. அவை பெரும்பாலும் யாரும் எதிர்பாராத வகையில் ரகசியத் தகவல்களைக் (credentials) கொண்டிருக்கும். ஒரு மாற்றி, யாரும் திறக்காத PDF கோப்பை, உங்கள் முகவர் (agent) தேவைப்படும்போது வாசிக்கும் கோப்பாக மாற்றுகிறது. உருவாக்கப்பட்ட கோப்புகளை நீங்கள் commit செய்வதற்கு முன் ஒருமுறை வாசித்துப் பார்க்கவும். மேலும், AI முகவர்களிடமிருந்து ரகசியங்களைப் பாதுகாத்தல் என்பதைப் பார்க்கவும்.

ஒரு மாற்றத்திற்கான செலவு என்ன?

கீழே உள்ள எண்கள் எங்களுடையவை அல்ல, திட்டத்தின் சொந்த அதிகாரப்பூர்வ அளவீடுகள் ஆகும்.

ChartCost to convert one full-length book, as published by the project
The data behind this chart
[
  {
    "label": "Think Python 2",
    "cost_usd": 0.88
  },
  {
    "label": "Working Backwards",
    "cost_usd": 0.96
  },
  {
    "label": "Pro Git",
    "cost_usd": 1.23
  },
  {
    "label": "Moby-Dick",
    "cost_usd": 1.42
  }
]

திட்டம் அளவிட்ட 4 புத்தகங்களில், ஒரு மாற்றத்திற்கு 0.88 முதல் 1.42 அமெரிக்க டாலர்கள் வரை செலவானது; Pro Git புத்தகத்திற்கு 1.23 செலவானது. இந்த புள்ளிவிவரங்கள் Claude Sonnet 4.5-ல் அளவிடப்பட்டன, tiktoken-லிருந்து டோக்கன் எண்ணிக்கைகள் cl100k_base-ஐப் பயன்படுத்தி பெறப்பட்டன, மேலும் இவை ஆகஸ்ட் 2026 நிலவரப்படி திட்டத்தின் docs/performance.md-ல் வெளியிடப்பட்டுள்ளன. உங்கள் சொந்த செலவு, நீங்கள் பயன்படுத்தும் model மற்றும் அதன் விலைகளைப் பொறுத்து மாறுபடும்.

ஒரு புத்தகத்தை முழுமையாக context-ல் பதிவேற்றுவதை விட, அந்தத் திறனிலிருந்து ஒரு கேள்விக்கு பதிலளிக்க 24 முதல் 51 மடங்கு குறைவான டோக்கன்களே தேவைப்படுவதையும் இந்தத் திட்டம் ஆவணப்படுத்துகிறது. இதை ஒரு வாக்குறுதியாகக் கருதாமல், சேமிப்பின் அளவாகக் கருதுங்கள், ஏனெனில் இது புத்தகத்தையும் கேள்வியையும் பொறுத்தது. இதன் கட்டமைப்பு ரீதியான உண்மை இதுதான்: மாற்றம் (conversion) ஒருமுறை மட்டுமே செலுத்தப்படுகிறது, ஆனால் context dump ஒவ்வொரு முறை உரையாடலின் போதும் மீண்டும் மீண்டும் கட்டணம் வசூலிக்கிறது.

PDF-ஐ ஏன் நகலெடுக்கக்கூடாது அல்லது RAG index-ஐ ஏன் உருவாக்கக்கூடாது?

PDF-ஐ நகலெடுப்பது (pasting) ஒரு ஆவணத்தைப் பற்றிய ஒரு கேள்விக்குச் சரியான தீர்வாகும். ஆனால், அதே புத்தகத்தை செவ்வாய்க்கிழமையும் வெள்ளிக்கிழமையும் பயன்படுத்த வேண்டியிருக்கும் போது, ஒவ்வொரு முறையும் அதன் முழு அளவிற்கான கட்டணத்தைச் செலுத்த வேண்டியிருப்பதால், இது சரியான தீர்வாக இருப்பதில்லை.

Retrieval அல்லது RAG (retrieval augmented generation), கேள்வி கேட்கப்படும் நேரத்தில் தேடி, உங்கள் சொற்களுக்குப் பொருந்தும் பகுதிகளைத் தருகிறது. உங்களுக்குத் துல்லியமான வாக்கியம் தேவைப்படும்போது இது வலுவானது. ஆனால், ஒரு முழு அத்தியாயத்தில் பரவியிருக்கும் ஒரு framework-ஐப் புரிந்துகொள்ள வேண்டியிருக்கும் போது இது பலவீனமானது, ஏனெனில் எந்த ஒரு தனிப் பகுதியிலும் முழுமையான தகவல் இருக்காது. ஒரு skill, தகவலை மாற்றும் (conversion) நேரத்திலேயே பிரித்தெடுத்து, அந்தப் பகுதிகளுக்குப் பதிலாக அதன் கட்டமைப்பைச் சேமித்து வைக்கிறது.

உண்மையான வரம்பு இதுதான்: உருவாக்கப்பட்ட ஒரு skill என்பது ஒரு model-ஆல் எழுதப்பட்ட, தகவல்கள் விடுபடக்கூடிய (lossy) சுருக்கமாகும். இது ஒரு படிப்பு உதவி மட்டுமே; மூல ஆவணமே முதன்மையானது. சட்டப்பூர்வமான அல்லது நெறிமுறை சார்ந்த முக்கியத்துவம் வாய்ந்த துல்லியமான சொற்கள் தேவைப்படும்போது, PDF-ஐ வைத்துக்கொண்டு அதிலிருந்து மேற்கோள் காட்டுங்கள். Skills compared against MCP servers and rules files பகுதி, எந்த அணுகுமுறை எங்கே பொருந்தும் என்பதை விளக்குகிறது.

தோல்வி முறைகள் மற்றும் நீங்கள் காணும் சரங்கள் (strings)

ஸ்கேன் செய்யப்பட்ட PDF எதையும் உருவாக்கவில்லை. பிரித்தெடுக்கும் கருவி (extractor) தொடக்கப் பக்கங்களில் உரை அடுக்கு (text layer) உள்ளதா என்று சரிபார்க்கும். 400 பக்கப் படங்களைச் செயலாக்குவதற்குப் பதிலாக, ஒரு விளக்கத்துடன் அது நின்றுவிடும். முதலில் ocrmypdf input.pdf output.pdf-ஐ இயக்கவும், பிறகு அதன் வெளியீட்டு கோப்பை உள்ளீடாக வழங்கவும்.

pip நிறுவுவதை மறுக்கிறது. Ubuntu 24.04-ல் error: externally-managed-environment என்பது கணினி Python-ஐப் பாதுகாக்கும் apt-ன் செயல்பாடு ஆகும். மேலே குறிப்பிட்டுள்ள virtual environment-ஐப் பயன்படுத்தவும் அல்லது poppler-utils-ஐ நிறுவி pip-ஐத் தவிர்க்கவும்.

அத்தியாயங்கள் தவறாக வருகின்றன. அத்தியாயங்களைக் கண்டறியும் அம்சம் Chapter 7 போன்ற தெளிவான தலைப்புகளைத் தேடும். வெறும் தலைப்புகள் அல்லது ரோமானிய எண்களைப் பயன்படுத்தும் புத்தகங்கள் தவறான பிரிப்பைக் கொடுக்கும். இது போன்ற நேரங்களில், கருவி தானாகக் கண்டறியும் என்று நம்புவதற்குப் பதிலாக, அத்தியாயங்கள் எங்கு தொடங்குகின்றன என்பதை நீங்களே குறிப்பிட வேண்டும்.

கட்டளை இல்லை. autocomplete-ல் /book-to-skill விடுபட்டிருந்தால், உங்கள் session தொடங்கிய பிறகு skills directory உருவாக்கப்பட்டிருக்கலாம் என்று அர்த்தம். agent-ஐ மறுதொடக்கம் (restart) செய்யவும்.

Docling அதிக நேரம் எடுத்துக்கொள்கிறது. ஒரு பக்கத்திற்கு சுமார் 1.5 வினாடிகள் வீதம், ஒரு நீண்ட புத்தகத்திற்கு இது பல நிமிட CPU நேரத்தை எடுத்துக்கொள்ளும். பகிரப்பட்ட server-ல் (shared server) இயங்கும்போது, நீங்கள் ஹோஸ்ட் செய்யும் பிற சேவைகளுடன் இது போட்டியிடும். உள்ளடக்க வகை குறித்து கேட்கும்போது "text-heavy" என்று பதிலளிக்கவும் அல்லது நீங்களே scripts/extract.py-ஐ இயக்கும்போது --mode text-ஐ வழங்கவும். --mode technical என்பது docling-ஐத் தேர்ந்தெடுப்பதற்கான விடையாகும்.

மூலக் கோப்பு (source) அமைதியாக மறைந்துவிடுகிறது. படிக்க முடியாத கோப்புகள் தவிர்க்கப்படும், இதனால் batch செயல்முறை முழுமையடையும். நீங்கள் வழங்கியதை விடக் குறைவான மூலங்களைக் கொண்டு செயல்முறை வெற்றி பெற்றதாக அறிக்கை அளிக்கும். இறுதி அறிக்கையில் உள்ள கோப்புப் பட்டியலில் (file inventory) மட்டுமே இதைக் காண முடியும்.

அதே முறையை கைமுறையாகப் பயன்படுத்துதல்

இந்தக் கருவி ஒரு வசதிக்காக மட்டுமே. இதன் கட்டமைப்புதான் மாற்றத்தக்கது; உங்களிடம் உள்ள எந்தவொரு குறிப்புப் பொருளுக்கும் ஒரு text editor மூலம் இதை உருவாக்கலாம்.

  1. ஒரு entry file-ஐ எழுதி, அதை converter இலக்காகக் கொள்ளும் 4,000 tokens-க்கு அருகில் வைக்கவும். அதில் பெயரிடப்பட்ட கருத்துகளையும் அவற்றின் துல்லியமான விளக்கங்களையும் சேர்க்கவும். அத்துடன், ஒவ்வொரு detail file-ஐயும் அதில் உள்ள தலைப்புகளையும் பட்டியலிடும் ஒரு index-ஐயும் அதில் சேர்க்கவும்.
  2. தகவல்களைத் தோராயமாக 1,000 tokens கொண்ட கோப்புகளாகப் பிரிக்கவும். ஒவ்வொரு கோப்பிலும் ஒரு தலைப்பு மட்டுமே இருக்க வேண்டும். கோப்பின் பெயரைப் பார்த்தாலே உள்ளே என்ன இருக்கிறது என்று தெரியும் வகையில் பெயரிடவும்.
  3. அந்த ஒவ்வொரு கோப்பையும் எப்போது படிக்க வேண்டும் என்பதை விளக்கும் வாக்கியத்துடன், entry file-லிருந்து விவரிக்கவும்.

படி 3-ஐத்தான் பலரும் தவிர்த்துவிடுவார்கள், ஆனால் இந்த முறையைச் செயல்பட வைப்பது அதுதான். Index-ஐப் படிப்பதன் மூலமே agent எதைத் திறக்க வேண்டும் என்பதைத் தீர்மானிக்கிறது. எனவே, index-ல் விவரிக்கப்படாத ஒரு கோப்பை agent ஒருபோதும் திறக்காது. Index என்பதுதான் தயாரிப்பு, chapter files என்பவை சேமிப்பகம் மட்டுமே.

Entry file-ஐ compaction budget-க்குள் வைத்திருங்கள்; அப்போதுதான் நீண்ட session-களிலும் முழு கட்டமைப்பும் சிதையாமல் இருக்கும். Converter கோப்புகளை உருவாக்கினாலும் அல்லது நீங்களே உருவாக்கினாலும் இந்த விதி பொருந்தும்.

FAQ

நான் வாங்கிய புத்தகத்திலிருந்து உருவாக்கப்பட்ட ஒரு திறனை (skill) என்னால் வெளியிட முடியுமா?

முடியாது, அந்தப் புத்தகத்தின் உரிமம் மறுவிநியோகத்தை அனுமதித்தால் ஒழிய. கன்வெர்ட்டரில் உள்ள MIT உரிமம் அதன் குறியீட்டிற்கு மட்டுமே பொருந்தும், நீங்கள் உள்ளீடு செய்யும் உள்ளடக்கத்திற்கு அல்ல; மேலும், உருவாக்கப்பட்ட திறன் அந்தப் புத்தகத்தின் வழித்தோன்றல் படைப்பாகும் (derivative work). அதை உங்கள் சொந்த கணினியில் ~/.claude/skills/-ல் வைத்திருங்கள். நீங்கள் சொந்தமாக எழுதிய ஆவணங்கள் அல்லது வெளிப்படையான உரிமம் கொண்ட ஆதாரங்களுக்கு வெளியிடுவது சரியானது. இந்த கருவி களஞ்சியத்தின் (repository) தெரிவுநிலை குறித்து தனியாகக் கேட்கிறது, public அல்லது private-ஐ மட்டுமே ஏற்கும், எனவே இந்த முடிவு வேண்டுமென்றே எடுக்கப்பட வேண்டும்.

எனக்கு docling தேவையா, அல்லது pdftotext போதுமானதா?

உரைநடைக்கு poppler-utils-லிருந்து வரும் pdftotext போதுமானது மற்றும் அது உடனடியாகச் செயல்படும். புத்தகத்தின் மதிப்பு அதன் அட்டவணைகள் மற்றும் குறியீட்டுப் பட்டியல்களில் (code listings) இருக்கும்போது docling-ஐ நிறுவுங்கள், ஏனெனில் எளிய உரை பிரித்தெடுக்கும் கருவி (plain text extractor) அவற்றை நீக்கிவிடும். இதில் வேகம் ஒரு காரணி: இந்தத் திட்டம் docling-ஐ ஒரு பக்கத்திற்கு சுமார் 1.5 வினாடிகள் என மதிப்பிடுகிறது, எனவே 300 பக்க கையேடு ஒரு VPS-ல் பல நிமிட CPU நேரத்தை எடுத்துக்கொள்ளும்.

எனது VPS-ல் externally-managed-environment என்று கூறி pip ஏன் தோல்வியடைகிறது?

Ubuntu 24.04 மற்றும் தற்போதைய Debian பதிப்புகள், கணினி Python-ஐ apt மூலம் நிர்வகிக்கப்படும் ஒன்றாகக் குறிக்கின்றன, எனவே pip அதில் நிறுவுவதை மறுத்து error: externally-managed-environment-ஐக் காட்டுகிறது. python3 -m venv ~/.venvs/book-to-skill மூலம் ஒரு virtual environment-ஐ உருவாக்கி, அதை activate செய்து, அதில் பிரித்தெடுக்கும் கருவிகளை நிறுவி, பின்னர் அதே shell-லிருந்து உங்கள் agent-ஐத் தொடங்கவும். இந்தத் திறன் python3-ஐ அழைப்பதால், அது உங்கள் PATH-ல் உள்ள interpreter-ஐப் பயன்படுத்தும், அது இப்போது virtual environment-ல் உள்ளதாக இருக்கும்.

நான் உருவாக்கிய திறன் ஏன் slash command-ஆகத் தெரியவில்லை?

இதற்கு இரண்டு காரணங்கள் உள்ளன. கட்டளையின் பெயர் கோப்பகத்தின் (directory) பெயரிலிருந்து வருகிறது, எனவே அந்தத் திறன் ~/.claude/skills/<name>/SKILL.md அல்லது .claude/skills/<name>/SKILL.md-ல் இருக்க வேண்டும், மேலும் SKILL.md சரியாக அந்த எழுத்துப்பிழையுடன் இருக்க வேண்டும். பாதை சரியாக இருந்தால், agent-ஐ மறுதொடக்கம் (restart) செய்யவும். Claude Code ஏற்கனவே கண்காணிக்கும் திறன் கோப்பகங்களுக்குள் செய்யப்படும் மாற்றங்களை எடுத்துக்கொள்ளும், ஆனால் session தொடங்கிய பிறகு உருவாக்கப்பட்ட ஒரு skills கோப்பகம் கண்காணிக்கப்படாது.