RuntimeError: Calculated padded input size per channel: (0). Kernel size: (1). Kernel size can't be greater than actual input size Setting `pad_token_id` to `eos_token_id`:None for open-end generation.
Voice Clone 部分出现异常,Creation部分工作正常 python3.12 && cuda 11.8
Setting pad_token_id to eos_token_id:None for open-end generation.
Traceback (most recent call last):
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\queueing.py", line 625, in process_events
response = await route_utils.call_process_api(
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\route_utils.py", line 322, in call_process_api
output = await app.get_blocks().process_api(
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\blocks.py", line 2096, in process_api
result = await self.call_function(
^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\blocks.py", line 1643, in call_function
prediction = await anyio.to_thread.run_sync( # type: ignore
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\anyio\to_thread.py", line 56, in run_sync
return await get_async_backend().run_sync_in_worker_thread(
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\anyio_backends_asyncio.py", line 2461, in run_sync_in_worker_thread
return await future
^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\anyio_backends_asyncio.py", line 962, in run
result = context.run(func, *args)
^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\gradio\\utils.py", line 890, in wrapper
response = f(*args, **kwargs)
^^^^^^^^^^^^^^^^^^
File "M:\AI\Spark-TTS\Spark-TTS\webui.py", line 94, in voice_clone
audio_output_path = run_tts(
^^^^^^^^
File "M:\AI\Spark-TTS\Spark-TTS\webui.py", line 62, in run_tts
wav = model.inference(
^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\\utils_contextlib.py", line 116, in decorate_context
return func(*args, **kwargs)
^^^^^^^^^^^^^^^^^^^^^
File "M:\AI\Spark-TTS\Spark-TTS\cli\SparkTTS.py", line 231, in inference
wav = self.audio_tokenizer.detokenize(
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "M:\AI\Spark-TTS\Spark-TTS\sparktts\models\audio_tokenizer.py", line 145, in detokenize
wav_rec = self.model.detokenize(semantic_tokens, global_tokens)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\\utils_contextlib.py", line 116, in decorate_context
return func(*args, **kwargs)
^^^^^^^^^^^^^^^^^^^^^
File "M:\AI\Spark-TTS\Spark-TTS\sparktts\models\bicodec.py", line 183, in detokenize
z_q = self.quantizer.detokenize(semantic_tokens)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "M:\AI\Spark-TTS\Spark-TTS\sparktts\modules\vq\factorized_vector_quantize.py", line 157, in detokenize
z_q = self.out_project(z_q)
^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\module.py", line 1736, in _wrapped_call_impl
return self._call_impl(*args, **kwargs)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\module.py", line 1747, in _call_impl
return forward_call(*args, **kwargs)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\conv.py", line 375, in forward
return self._conv_forward(input, self.weight, self.bias)
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "D:\Users\MirraAI\anaconda3\envs\sparktts\Lib\site-packages\torch\nn\modules\conv.py", line 370, in _conv_forward
return F.conv1d(
^^^^^^^^^
RuntimeError: Calculated padded input size per channel: (0). Kernel size: (1). Kernel size can't be greater than actual input size
Setting pad_token_id to eos_token_id:None for open-end generation.
Source: SparkAudio/Spark-TTS