RuntimeError: Calculated padded input size per channel: (0). Kernel size: (1). Kernel size can't be greater than actual input size Setting `pad_token_id` to `eos_token_id`:None for open-end generation.

Author: NekoMirraCreated Mar 8, 2025Updated Oct 8, 2025

Voice Clone 部分出现异常,Creation部分工作正常 python3.12 && cuda 11.8

Setting pad_token_id to eos_token_id:None for open-end generation. Traceback (most recent call last): File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\queueing.py", line 625, in process_events response = await route_utils.call_process_api( ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\route_utils.py", line 322, in call_process_api output = await app.get_blocks().process_api( ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\blocks.py", line 2096, in process_api result = await self.call_function( ^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\blocks.py", line 1643, in call_function prediction = await anyio.to_thread.run_sync( # type: ignore ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\anyio\to_thread.py", line 56, in run_sync return await get_async_backend().run_sync_in_worker_thread( ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\anyio_backends_asyncio.py", line 2461, in run_sync_in_worker_thread return await future ^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\anyio_backends_asyncio.py", line 962, in run result = context.run(func, *args) ^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\\utils.py", line 890, in wrapper response = f(*args, **kwargs) ^^^^^^^^^^^^^^^^^^ File "M:\AI\Spark-TTS\Spark-TTS\webui.py", line 94, in voice_clone audio_output_path = run_tts( ^^^^^^^^ File "M:\AI\Spark-TTS\Spark-TTS\webui.py", line 62, in run_tts wav = model.inference( ^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\\utils_contextlib.py", line 116, in decorate_context return func(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^ File "M:\AI\Spark-TTS\Spark-TTS\cli\SparkTTS.py", line 231, in inference wav = self.audio_tokenizer.detokenize( ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "M:\AI\Spark-TTS\Spark-TTS\sparktts\models\audio_tokenizer.py", line 145, in detokenize wav_rec = self.model.detokenize(semantic_tokens, global_tokens) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\\utils_contextlib.py", line 116, in decorate_context return func(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^ File "M:\AI\Spark-TTS\Spark-TTS\sparktts\models\bicodec.py", line 183, in detokenize z_q = self.quantizer.detokenize(semantic_tokens) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "M:\AI\Spark-TTS\Spark-TTS\sparktts\modules\vq\factorized_vector_quantize.py", line 157, in detokenize z_q = self.out_project(z_q) ^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\module.py", line 1736, in _wrapped_call_impl return self._call_impl(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\module.py", line 1747, in _call_impl return forward_call(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\conv.py", line 375, in forward return self._conv_forward(input, self.weight, self.bias) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\conv.py", line 370, in _conv_forward return F.conv1d( ^^^^^^^^^ RuntimeError: Calculated padded input size per channel: (0). Kernel size: (1). Kernel size can't be greater than actual input size Setting pad_token_id to eos_token_id:None for open-end generation.