หน้าแรก › MarTechPlace › video-use: ตัดต่อวิดีโอด้วย Claude Code แค่พิมพ์สั่ง ไม่ต้องดูทีละเฟรม
M Creation

video-use: ตัดต่อวิดีโอด้วย Claude Code แค่พิมพ์สั่ง ไม่ต้องดูทีละเฟรม

ชวัลวิทย์ รักษพล26 ก.ย. 2569อ่าน 35 นาที
video-use: ตัดต่อวิดีโอด้วย Claude Code แค่พิมพ์สั่ง ไม่ต้องดูทีละเฟรม

งานตัดคลิปพูดหน้ากล้องเป็นงานที่ผมไม่ชอบที่สุด ไม่ใช่เพราะมันยาก แต่เพราะมันน่าเบื่อ นั่งฟังตัวเองพูด "เอ่อ" ซ้ำไปมา หาจุดที่พูดผิดแล้วพูดใหม่ ตัดทีละช่วง แล้วค่อยมาแก้เสียงที่ดัง "ป๊อก" ตรงรอยต่อ คลิป 5 นาทีกินเวลาเป็นชั่วโมงได้สบาย ๆ

ช่วงนี้ผมเจอ video-use ซึ่งเป็นสกิลโอเพนซอร์สจากทีม browser-use ที่ให้ Claude Code ตัดต่อวิดีโอด้วยการคุยกัน เราโยนไฟล์ดิบไว้ในโฟลเดอร์ บอกว่าอยากได้คลิปแบบไหน แล้วมันส่ง final.mp4 กลับมา บทความนี้ผมติดตั้งจริงบน Mac ของผมเอง ภาพหน้าจอทุกภาพมาจากผลลัพธ์จริง ส่วนไหนที่ยังไม่ได้ลองเพราะติดเงื่อนไข ผมจะบอกไว้ตรง ๆ

INSTALLATION
$ npx skills add https://github.com/browser-use/video-use --skill video-use
Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
SUMMARY

ให้ Claude Code ตัดต่อวิดีโอด้วยการคุย ถอดเสียงทีละคำ วางแผนจุดตัด แล้วเรนเดอร์ final.mp4 ให้เอง

  • ตัดคำเติม ช่วงพูดผิด และช่วงเงียบ โดยตัดตรงขอบคำจากทรานสคริปต์ของ ElevenLabs Scribe
  • อ่านวิดีโอจากทรานสคริปต์กับภาพ timeline เฉพาะจุดที่ต้องตัดสินใจ แทนการดูทุกเฟรม จึงประหยัด token
  • เสนอแผนให้เรายืนยันก่อนตัดทุกครั้ง และตรวจงานที่เรนเดอร์ทุกจุดตัดก่อนส่งให้ดู
  • ใส่ซับ เกรดสี fade เสียง 30ms และแอนิเมชันซ้อนภาพได้ ผลงานทั้งหมดอยู่ในโฟลเดอร์ edit/

ตัวเลขจาก skills.sh และ GitHub ณ 26 ก.ย. 2569

วิธีใช้ติดตั้งและเริ่มตัดคลิปแรก

ต้องเตรียมอะไรบ้าง

  • Claude Code หรือเอเจนต์ที่รันคำสั่งในเครื่องได้ (Codex, Hermes, Openclaw ก็ใช้ได้ตาม README)
  • ffmpeg และ ffprobe ต้องมีแน่นอน บน Mac ใช้ brew install ffmpeg ได้ เวอร์ชัน 4 ขึ้นไปก็พอ
  • Python พร้อมไลบรารี requests, librosa, matplotlib, pillow, numpy โดย pyproject.toml ระบุ Python 3.10 ขึ้นไป
  • yt-dlp ไม่บังคับ ใช้เมื่ออยากดึงคลิปจากลิงก์ออนไลน์
  • Node.js ไม่บังคับเหมือนกัน ใช้เมื่อต้องทำแอนิเมชันด้วย HyperFrames (ต้อง Node 22 ขึ้นไป) หรือ Remotion
  • API key ของ ElevenLabs ใช้ถอดเสียง ถ้าไม่มีคีย์ ขั้นถอดเสียงจะไม่ทำงาน ซึ่งก็คือเริ่มตัดไม่ได้

เรื่องค่าใช้จ่าย ตัวสกิลฟรี แต่ Scribe ของ ElevenLabs คิดเงินตามความยาวเสียงที่ส่งไปถอด ตอนที่ผมเช็กหน้า ElevenLabs API pricing (25 ก.ย. 2569) หน้านั้นแสดง Scribe v2 ที่ $0.22 ต่อชั่วโมงเสียง และบอกว่าคิดตามนาทีจริง แพ็กเกจรายเดือนแต่ละระดับก็มีชั่วโมงถอดเสียงรวมมาให้ต่างกัน มีจุดหนึ่งที่ต้องสังเกตคือ สคริปต์ transcribe.py เวอร์ชันที่ผมโหลดมาเรียกโมเดล scribe_v1 ราคาอาจไม่เท่ากับ v2 และราคาพวกนี้เปลี่ยนบ่อย ก่อนใช้งานจริงควรเข้าไปเช็กในหน้า pricing เอง ข้อดีคือระบบเก็บทรานสคริปต์ไว้ ไฟล์เดิมจะไม่ถูกส่งไปถอดซ้ำ

ติดตั้ง video-use ใน 5 ขั้น

ถ้าไม่อยากพิมพ์คำสั่งเอง README มีพรอมต์สำเร็จรูปให้วางใน Claude Code แล้วให้มันติดตั้งให้ทั้งหมด

ส่วน Setup prompt ใน README ของ video-use บน GitHub พร้อมข้อความพรอมต์สำหรับวางใน Claude Code, Codex หรือเอเจนต์อื่น
ส่วน Setup prompt ใน README วางพรอมต์นี้ในเอเจนต์ได้เลย
Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Claude จะอ่าน install.md แล้ว clone repo ติดตั้งไลบรารี ลงทะเบียนสกิล และถามคีย์ ElevenLabs จากเราครั้งเดียว ส่วนใครอยากรู้ว่าข้างในทำอะไรบ้าง หรืออยากคุมเองทุกขั้นเหมือนผม ทำตามนี้ได้เลย

ขั้นที่ 1: clone repo ไว้ในที่ถาวร

ไฟล์คู่มือแนะนำให้เก็บไว้ในที่ที่ไม่ถูกลบ เช่น ~/Developer/video-use อย่าเก็บใน /tmp หรือ Downloads

git clone https://github.com/browser-use/video-use ~/Developer/video-use
cd ~/Developer/video-use
หน้าจอเทอร์มินัลแสดงผลคำสั่ง git clone repo video-use สำเร็จ ดาวน์โหลด 352 objects ขนาด 1.05 MiB
ผลลัพธ์จริงตอน clone ทั้ง repo มีขนาดราว 1 MB

ขั้นที่ 2: ติดตั้งไลบรารี Python

ถ้ามี uv ใช้ uv sync ได้เลย ถ้าไม่มีใช้ pip แทน เครื่องผมไม่ได้ลง uv ไว้ เลยติดตั้งไลบรารีทั้ง 5 ตัวตรง ๆ

pip3 install --user requests librosa matplotlib pillow numpy
หน้าจอเทอร์มินัลแสดงผล pip3 install ติดตั้ง librosa, matplotlib, numpy, requests และไลบรารีที่เกี่ยวข้องสำเร็จ
ผลลัพธ์จริงของ pip ผมตัด log ช่วงดาวน์โหลดออก เหลือแค่บรรทัดสรุป

มีเรื่องหนึ่งที่ผมเจอเอง Python ที่มากับ macOS ของผมเป็น 3.9 แต่ pyproject.toml ระบุ 3.10 ขึ้นไป คำสั่ง pip install -e . จึงไม่ผ่าน ผมเลยติดตั้งไลบรารีแยกทีละตัวแทน และ helper ที่ผมลองรันก็ทำงานได้ แต่ถ้าจะใช้ยาว ๆ ผมแนะนำให้ลง Python 3.10 ขึ้นไป หรือลง uv แล้วใช้ uv sync จะตรงกับที่โปรเจกต์ออกแบบไว้มากกว่า

ขั้นที่ 3: ติดตั้ง ffmpeg

command -v ffmpeg >/dev/null || brew install ffmpeg
command -v yt-dlp >/dev/null || brew install yt-dlp   # ไม่บังคับ

เช็กว่าเรียกใช้ได้ด้วย ffmpeg -version | head -1 เครื่องผมมี ffmpeg 9.0.1 อยู่แล้ว เลยข้ามขั้นนี้ไป

ขั้นที่ 4: ลงทะเบียนสกิลกับ Claude Code

ให้ symlink ทั้งโฟลเดอร์เข้าไปใน ~/.claude/skills ต้องลิงก์ทั้งโฟลเดอร์ ไม่ใช่แค่ไฟล์ SKILL.md เพราะสคริปต์ใน helpers/ ต้องอยู่ข้างกัน

mkdir -p ~/.claude/skills
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use

ถ้าใช้ Codex ให้เปลี่ยนปลายทางเป็น ~/.codex/skills/video-use พอเปิด Claude Code รอบถัดไป จะเห็น video-use อยู่ในรายการสกิล ตอนผมติดตั้ง สกิลขึ้นในรายการของ Claude Code ทันทีโดยไม่ต้องตั้งค่าอะไรเพิ่ม

หน้าจอเทอร์มินัลตรวจเวอร์ชัน ffmpeg, ffprobe, yt-dlp แสดงไฟล์ในโฟลเดอร์สกิล video-use และไฟล์ .env ที่ยังไม่ได้ใส่คีย์
ตรวจเครื่องมือและโฟลเดอร์สกิลหลังติดตั้ง ไฟล์ .env ยังว่างเพราะผมยังไม่ได้ใส่คีย์

ทริกสำหรับคนเก็บงานไว้ใน external SSD ที่ฟอร์แมตเป็น exFAT: macOS จะสร้างไฟล์ขยะชื่อขึ้นต้นด้วย ._ ติดมาด้วย ไฟล์พวกนี้ไม่ส่งผลกับการทำงานของสกิล แต่ถ้าไปอยู่ในโฟลเดอร์ .git จะทำให้ git ฟ้อง error ตอน clone ผมแก้ด้วยการลบไฟล์ ._* ใน .git แล้วเพิ่ม ._* ลงใน .git/info/exclude จากนั้นก็ใช้ได้ปกติ

ขั้นที่ 5: ใส่ API key ของ ElevenLabs

สร้างคีย์ได้ที่ elevenlabs.io/app/settings/api-keys ต้องล็อกอินก่อน ถ้ายังไม่มีบัญชีก็สมัครจากหน้านี้ได้

หน้าล็อกอินของ ElevenLabs ที่ขึ้นมาเมื่อเปิดลิงก์หน้า API keys โดยยังไม่ได้เข้าสู่ระบบ
เปิดลิงก์หน้า API keys ตอนยังไม่ล็อกอิน จะเจอหน้านี้ก่อน

ได้คีย์มาแล้วให้ใส่ในไฟล์ .env ที่โฟลเดอร์ของ repo

cd ~/Developer/video-use
cp .env.example .env
chmod 600 .env
open -e .env        # แก้เป็น ELEVENLABS_API_KEY=คีย์ของคุณ

ไฟล์ .env อยู่ใน .gitignore ของโปรเจกต์อยู่แล้ว เลยไม่หลุดขึ้น git แน่นอน อย่าเอาคีย์ไปวางในโฟลเดอร์วิดีโอหรือส่งให้ใคร ถ้าอยากเช็กว่าคีย์ใช้ได้ install.md แนะนำให้เรียก endpoint /v1/user ซึ่งไม่เสียโควตา ถ้าได้ 200 แปลว่าคีย์ใช้ได้ ถ้าได้ 401 แปลว่าคีย์ผิดหรือหมดอายุ

curl -s -o /dev/null -w '%{http_code}\n' \
  -H "xi-api-key: $(sed -n 's/^ELEVENLABS_API_KEY=//p' ~/Developer/video-use/.env)" \
  https://api.elevenlabs.io/v1/user

ทดสอบว่าติดตั้งเสร็จจริง

install.md ระบุว่าอย่าเชื่อแค่ว่ามีไฟล์ครบ ให้ลองรันคำสั่งจริงกับไฟล์จริงสักครั้ง ผมเริ่มจากเรียก --help ของ timeline_view ก่อน

หน้าจอเทอร์มินัลแสดงผลคำสั่ง python3 helpers/timeline_view.py --help พร้อมตัวเลือก output, n-frames และ transcript
helper ตอบกลับปกติ แปลว่าไลบรารี Python ติดตั้งครบแล้ว

จากนั้นผมสร้างคลิปทดสอบยาว 10 วินาทีด้วย ffmpeg (ภาพแถบสีกับเสียงที่ดังสลับกับช่วงเงียบ) แล้วรัน timeline_view กับช่วงวินาทีที่ 1 ถึง 7 ขั้นนี้ไม่ต้องใช้คีย์ ElevenLabs และไม่เสียเงิน

หน้าจอเทอร์มินัลรัน ffprobe ตรวจคลิปทดสอบ 1280x720 ยาว 10 วินาที แล้วรัน timeline_view.py สร้างไฟล์ timeline_test.png สำเร็จ
รัน timeline_view กับคลิปทดสอบ ได้ไฟล์ PNG ขนาด 290 KB
ภาพผลลัพธ์จริงจาก timeline_view.py มีแถบเฟรม 10 ภาพของคลิปทดสอบ และคลื่นเสียงที่เห็นช่วงมีเสียงสลับกับช่วงเงียบชัดเจน
ภาพที่ Claude ใช้ดูตอนตัดสินใจจุดตัด ช่วงคลื่นแบนคือช่วงเงียบ ถ้ามีทรานสคริปต์ด้วย จะมีคำพูดกำกับบนคลื่นเสียง

ลองตัดคลิปแรก

ส่วนนี้ผมเขียนตามคู่มือใน SKILL.md เพราะเครื่องผมยังไม่ได้ใส่คีย์ ElevenLabs เลยยังไม่ได้ลองถอดเสียงจริง วิธีใช้คือเอาไฟล์วิดีโอดิบทั้งหมดไว้ในโฟลเดอร์เดียว แล้วเปิด Claude Code จากโฟลเดอร์นั้น

cd ~/Videos/review-product-a
claude

แล้วพิมพ์บอกสิ่งที่ต้องการ เช่น

  • "ตัดคลิปพวกนี้เป็นวิดีโอรีวิวสินค้าแนวตั้ง ยาวไม่เกิน 60 วินาที ตัดคำเติมกับช่วงพูดผิดออก"
  • "ดูเทคทั้งหมดก่อน แล้วเสนอแผนมาให้ผมดู"
  • หรือใช้ประโยคตัวอย่างจาก README: "edit these into a launch video"

ขั้นแรก Claude จะตรวจไฟล์ทุกไฟล์ด้วย ffprobe ถอดเสียง รวมทรานสคริปต์ แล้วอธิบายว่าเจออะไรในฟุตเทจ จากนั้นจะถามคำถามตามเนื้อหาจริง เช่น เป็นคลิปแนวไหน ต้องการความยาวและสัดส่วนภาพเท่าไร ช่วงไหนต้องเก็บไว้ อยากได้ซับไตเติลหรือเกรดสีหรือเปล่า แล้วเสนอแผน 4–8 ประโยค จะยังไม่ตัดจนกว่าเราจะตอบตกลง ข้อนี้เป็นกฎตายตัวของสกิล

งานทุกอย่างจะไปอยู่ในโฟลเดอร์ edit/ ข้างไฟล์ต้นฉบับ ไฟล์ดิบไม่ถูกแตะ ในโฟลเดอร์นั้นจะมี

  • final.mp4 และ preview.mp4 ไฟล์งานจริงและตัวอย่างความละเอียด 720p
  • takes_packed.md ทรานสคริปต์แบบย่อที่ Claude ใช้อ่าน
  • edl.json รายการจุดตัด ระบุว่าแต่ละช่วงมาจากไฟล์ไหน วินาทีที่เท่าไร และเหตุผลที่เลือก
  • master.srt ซับไตเติลที่เทียบเวลากับคลิปที่ตัดแล้ว
  • transcripts/ ทรานสคริปต์ดิบที่เก็บไว้ใช้ซ้ำ
  • verify/ ภาพ timeline ที่ใช้ตรวจจุดตัด
  • project.md บันทึกของแต่ละรอบ ว่าตัดสินใจอะไรไปบ้างและยังค้างอะไร

ถ้าดู preview แล้วไม่ชอบ ก็บอกเป็นภาษาปกติได้ เช่น "ช่วงเปิดยาวไป ตัดให้เหลือ 3 วินาที" Claude จะแก้แผนแล้วเรนเดอร์ใหม่โดยไม่ถอดเสียงซ้ำ

รีวิวมันคืออะไร ทำงานยังไง และข้อจำกัด

video-use คืออะไร

video-use คือชุดคำสั่ง (skill) สำหรับ Claude Code และเอเจนต์ตัวอื่นที่รันคำสั่งในเครื่องได้ เช่น Codex หรือ Hermes เป็นโปรเจกต์ MIT license มีไฟล์หลักอยู่ 2 ส่วน ส่วนแรกคือ SKILL.md ซึ่งเป็นคู่มือที่ Claude อ่านก่อนทำงาน อีกส่วนคือโฟลเดอร์ helpers/ ที่มีสคริปต์ Python สำหรับถอดเสียง ตัดต่อ เกรดสี และเรนเดอร์ ทุกอย่างรันผ่าน ffmpeg ในเครื่องเรา

หน้า GitHub ของ repo browser-use/video-use แสดงรายการไฟล์ helpers, SKILL.md, install.md และคำอธิบาย Edit videos with coding agents
หน้า repo บน GitHub ตอนที่ผมเข้าไปดู (ก.ย. 2569) ใช้ MIT license

ความสามารถที่ README เขียนไว้มีประมาณนี้

  • ตัดคำเติม เช่น "อืม" "เอ่อ" การพูดผิดแล้วเริ่มใหม่ และช่วงเงียบระหว่างเทค
  • เกรดสีแต่ละช่วงอัตโนมัติ หรือใส่ filter ของ ffmpeg เองก็ได้
  • ใส่ audio fade 30 มิลลิวินาทีทุกรอยตัด จะได้ไม่มีเสียงป๊อก
  • ฝังซับไตเติลตามสไตล์ที่เราต้องการ ค่าเริ่มต้นเป็นตัวพิมพ์ใหญ่ครั้งละ 2 คำ
  • สร้างแอนิเมชันซ้อนภาพด้วย HyperFrames, Remotion, Manim หรือ PIL โดยแยก sub-agent ทำพร้อมกัน
  • ตรวจงานที่เรนเดอร์ออกมาเองทุกจุดตัดก่อนส่งให้เราดู
  • จำสิ่งที่คุยกันไว้ในไฟล์ project.md สัปดาห์หน้ามาทำต่อได้เลย

ทำไมมันตัดได้โดยไม่ต้อง "ดู" วิดีโอ

จุดที่ผมว่าฉลาดที่สุดคือ Claude ไม่ได้ดูวิดีโอทีละเฟรม ถ้าทำแบบนั้น README คำนวณไว้ว่าจะเปลือง token ระดับหลายสิบล้าน video-use ใช้วิธี "อ่าน" วิดีโอผ่านข้อมูล 2 ชั้นแทน

  1. ทรานสคริปต์เสียง (โหลดตลอด) ส่งไฟล์ไปถอดเสียงกับ ElevenLabs Scribe ไฟล์ละครั้ง ได้เวลาเริ่มและจบของทุกคำ แยกผู้พูด และจับเสียงอย่างเสียงหัวเราะหรือเสียงปรบมือ จากนั้นสคริปต์จะรวบทุกเทคเป็นไฟล์ข้อความเดียวชื่อ takes_packed.md ขนาดราว 12KB แบ่งเป็นวลีตามช่วงเงียบ Claude อ่านไฟล์นี้เป็นหลัก
  2. ภาพประกอบ timeline (เรียกใช้เมื่อจำเป็น) สคริปต์ timeline_view.py สร้าง PNG ที่มีแถบภาพเฟรม คลื่นเสียง คำพูด และช่วงเงียบ ใช้เฉพาะตอนต้องตัดสินใจ เช่น ช่วงหยุดที่ไม่แน่ใจ หรือเทียบว่าเทคไหนดีกว่า
แผนภาพ timeline view ของ video-use แสดงแถบเฟรม ผู้พูด คลื่นเสียง คำพูดแต่ละคำ และช่วงเงียบ 620ms กับ 880ms ที่ถูกเลือกเป็นจุดตัด
ภาพอธิบายจาก repo: ช่วงเงียบตั้งแต่ 400ms ขึ้นไปคือจุดที่ตัดได้ปลอดภัย คำพูดบอกขอบเขตที่แม่นยำ ส่วนเสียงอย่าง (laughter) คือจังหวะที่ควรเก็บไว้

ขั้นตอนทำงานทั้งหมดคือ ถอดเสียง → รวมทรานสคริปต์ → Claude วางแผน → เขียนรายการจุดตัด (edl.json) → เรนเดอร์ → ตรวจงานตัวเอง ถ้าเจอปัญหาจะแก้แล้วเรนเดอร์ใหม่ได้สูงสุด 3 รอบ ถ้ายังไม่ผ่านจะแจ้งเรา ไม่วนแก้ไปเรื่อย ๆ

กฎเหล็ก 12 ข้อ: ทำไมมันไม่ตัดกลางคำ และไม่มีเสียงป๊อก

SKILL.md มี "กฎเหล็ก" 12 ข้อ ส่วนเรื่องสไตล์และรสนิยมเปิดให้ Claude ตัดสินใจเองตามงาน สรุปเป็นภาษาคนได้ประมาณนี้

  1. ซับไตเติลต้องใส่เป็นอย่างสุดท้าย หลังภาพซ้อนทั้งหมด ไม่งั้นภาพซ้อนจะบังซับ
  2. ตัดทีละช่วงแล้วต่อกันแบบไม่เข้ารหัสซ้ำ ภาพจะได้ไม่เสื่อมจากการ encode สองรอบ
  3. ใส่ fade เสียง 30 มิลลิวินาทีทุกรอยต่อ เป็นเหตุผลที่ไม่มีเสียงป๊อก
  4. ภาพซ้อนต้องเลื่อนเวลาให้เฟรมแรกเริ่มตรงจุดที่วางไว้ ไม่งั้นจะไปเห็นแอนิเมชันตั้งแต่กลางเรื่อง
  5. เวลาของซับต้องคำนวณตามไทม์ไลน์ของคลิปที่ตัดแล้ว ไม่ใช่ตามไฟล์ต้นฉบับ
  6. ห้ามตัดกลางคำ ทุกจุดตัดต้องตรงกับขอบคำจากทรานสคริปต์
  7. เผื่อขอบจุดตัด 30–200 มิลลิวินาที เพราะเวลาจาก Scribe คลาดได้ 50–100 มิลลิวินาที
  8. ต้องใช้ทรานสคริปต์ระดับคำแบบคำต่อคำเท่านั้น ห้ามใช้ซับแบบวลี และห้ามตัดคำเติมทิ้งตั้งแต่ขั้นถอดเสียง เพราะคำพวกนั้นเป็นข้อมูลสำหรับการตัดต่อ
  9. เก็บทรานสคริปต์ไว้ ไม่ถอดไฟล์เดิมซ้ำ (ประหยัดเงินด้วย)
  10. ถ้ามีแอนิเมชันหลายชิ้น ให้แยก sub-agent ทำพร้อมกัน
  11. ต้องได้ OK จากเราก่อนลงมือตัด
  12. ไฟล์ทุกอย่างอยู่ใน edit/ ห้ามเขียนลงโฟลเดอร์ของสกิล

ข้อ 3, 6 และ 7 รวมกันคือเหตุผลที่คลิปออกมาไม่กระตุก จุดตัดที่ปลอดภัยที่สุดคือช่วงเงียบตั้งแต่ 400 มิลลิวินาทีขึ้นไป ช่วง 150–400 มิลลิวินาทีใช้ได้แต่ต้องดูภาพประกอบก่อน ส่วนช่วงที่สั้นกว่า 150 มิลลิวินาทีถือว่าไม่ปลอดภัย เพราะมักเป็นช่วงกลางประโยค

ข้อจำกัดที่ควรรู้ก่อนใช้

  • ต้องมีคีย์ ElevenLabs และมีค่าใช้จ่าย ขั้นถอดเสียงใช้ Scribe ที่เป็นบริการออนไลน์เท่านั้น SKILL.md บอกตรง ๆ ว่าไม่แนะนำ Whisper ในเครื่อง เพราะช้า และมักตัดคำเติมทิ้ง ซึ่งเป็นข้อมูลที่สกิลต้องใช้
  • ไฟล์เสียงถูกส่งออกไปนอกเครื่อง ถ้าเป็นคลิปลูกค้าหรือคลิปที่มีข้อมูลลับ ต้องดูเงื่อนไขของ ElevenLabs ก่อน
  • Claude ไม่ได้ยินเสียงจริง คู่มือเขียนไว้เองว่ามันวัดความดังเป็นตัวเลขได้ แต่บอกไม่ได้ว่าเพลงเพราะหรือเปล่า เรื่องเพลงและเสียงประกอบคนต้องฟังเองก่อนปล่อย
  • เหมาะกับคลิปที่มีคนพูดเป็นหลัก เพราะจุดตัดมาจากเสียงพูดกับช่วงเงียบ คลิปที่ไม่มีเสียงพูดเลย เช่น มอนทาจประกอบเพลง ยังทำได้แต่ต้องคุยรายละเอียดเยอะกว่า
  • แอนิเมชันต้องติดตั้งเพิ่ม HyperFrames และ Remotion ต้องใช้ Node.js ส่วน Manim ต้องลงแยก สกิลจะติดตั้งเมื่อจำเป็นต้องใช้เท่านั้น
  • ใช้ token ของ Claude ถึงจะประหยัดกว่าให้ดูทุกเฟรมมาก แต่งานหลายเทคก็ยังกินโควตาพอสมควร
  • ยังเป็นโปรเจกต์ใหม่ ยังไม่มี release อย่างเป็นทางการ อัปเดตโค้ดด้วย git pull --ff-only ได้ ถ้า dependency เปลี่ยนต้องติดตั้งไลบรารีใหม่ด้วย

คำถามที่พบบ่อย

video-use ใช้ฟรีไหม

ตัวสกิลเป็นโอเพนซอร์ส MIT ใช้ฟรี แต่มีค่าใช้จ่ายสองส่วน คือค่าถอดเสียงของ ElevenLabs Scribe ที่คิดตามความยาวเสียง กับค่าใช้ Claude Code ตามแพ็กเกจที่เราใช้อยู่ ผมแนะนำให้ลองกับคลิปสั้น ๆ ก่อนแล้วดูว่าใช้ไปเท่าไร

ใช้กับคลิปพูดภาษาไทยได้ไหม

หน้าราคาของ ElevenLabs ระบุว่า Scribe รองรับมากกว่า 90 ภาษา และ transcribe.py มีตัวเลือก --language ให้ระบุรหัสภาษาได้ ถ้าไม่ระบุจะตรวจจับภาษาเอง ผมยังไม่ได้ทดสอบกับคลิปภาษาไทยจริงเพราะยังไม่ได้ใส่คีย์ ใครจะใช้กับงานจริงควรลองกับคลิปสั้นก่อน และดูว่าขอบคำในทรานสคริปต์แม่นพอหรือเปล่า

ไม่มีคีย์ ElevenLabs ใช้ได้ไหม

ติดตั้งได้ และใช้ helper บางตัวที่ไม่ต้องถอดเสียงได้ เช่น timeline_view.py หรือ grade.py สำหรับเกรดสี แต่ขั้นตัดต่อหลักต้องใช้ทรานสคริปต์ ถ้าไม่มีคีย์ก็ตัดตามคำพูดไม่ได้

ต้องเขียนโค้ดเป็นไหม

ไม่ต้อง ถ้าใช้พรอมต์ติดตั้งจาก README Claude จะจัดการให้เกือบทั้งหมด เหลือแค่วางคีย์กับกดยืนยันตอนลงโปรแกรม แต่ถ้าพอใช้เทอร์มินัลเป็นบ้างจะแก้ปัญหาเองได้ง่ายขึ้น เช่น กรณีเวอร์ชัน Python ไม่ตรงอย่างที่ผมเจอ

ไฟล์วิดีโอต้นฉบับจะโดนแก้ไหม

ไม่โดน กฎของสกิลกำหนดให้ทุกอย่างเขียนลงโฟลเดอร์ edit/ ข้างไฟล์ต้นฉบับ ตัวไฟล์ดิบไม่ถูกแก้ และโฟลเดอร์ของสกิลก็ไม่มีไฟล์งานไปปน