//go:build darwin package engine import ( "fmt" "voicesnap/internal/logger" "voicesnap/internal/model" _ "github.com/k2-fsa/sherpa-onnx-go-macos" sherpa "github.com/k2-fsa/sherpa-onnx-go/sherpa_onnx" ) type sherpaEngine struct { recognizer *sherpa.OfflineRecognizer hwInfo string } func newPlatformEngine(resolved model.ResolvedModel) (Engine, error) { if !isSupportedBackend(resolved.BackendKind) { return nil, fmt.Errorf("unsupported backend kind: %s", resolved.BackendKind) } providers := darwinProviders(resolved.ProviderOrder) for _, p := range providers { config, err := offlineConfigForResolvedModel(resolved, p.provider) if err != nil { return nil, err } recognizer := sherpa.NewOfflineRecognizer(&config) if recognizer != nil { info := fmt.Sprintf("%s ยท %s", resolved.Profile.DisplayName, p.name) logger.Info("Engine initialized: %s", info) return &sherpaEngine{ recognizer: recognizer, hwInfo: info, }, nil } logger.Info("Failed to init with %s, trying next provider", p.name) } return nil, fmt.Errorf("failed to initialize sherpa-onnx with any provider") } func offlineConfigForResolvedModel(resolved model.ResolvedModel, provider string) (sherpa.OfflineRecognizerConfig, error) { config := sherpa.OfflineRecognizerConfig{} config.FeatConfig.SampleRate = 16000 config.FeatConfig.FeatureDim = 80 config.ModelConfig.Tokens = resolved.Files["tokens"] config.ModelConfig.NumThreads = resolved.Profile.NumThreads config.ModelConfig.Provider = provider config.DecodingMethod = "greedy_search" switch resolved.BackendKind { case model.BackendSenseVoice: config.ModelConfig.SenseVoice.Model = resolved.Files["model"] config.ModelConfig.SenseVoice.UseInverseTextNormalization = 1 case model.BackendMoonshine: config.ModelConfig.Moonshine.Preprocessor = resolved.Files["preprocessor"] config.ModelConfig.Moonshine.Encoder = resolved.Files["encoder"] config.ModelConfig.Moonshine.UncachedDecoder = resolved.Files["uncached_decoder"] config.ModelConfig.Moonshine.CachedDecoder = resolved.Files["cached_decoder"] case model.BackendNemoTransducer: config.ModelConfig.Transducer.Encoder = resolved.Files["encoder"] config.ModelConfig.Transducer.Decoder = resolved.Files["decoder"] config.ModelConfig.Transducer.Joiner = resolved.Files["joiner"] config.ModelConfig.ModelType = model.BackendNemoTransducer default: return sherpa.OfflineRecognizerConfig{}, fmt.Errorf("unsupported backend kind: %s", resolved.BackendKind) } return config, nil } func darwinProviders(providerOrder []string) []struct { name string provider string } { names := map[string]string{ "coreml": "CoreML (Apple Neural Engine)", "cpu": "CPU", } providers := make([]struct { name string provider string }, 0, len(providerOrder)) for _, provider := range providerOrder { name, ok := names[provider] if !ok { continue } providers = append(providers, struct { name string provider string }{name: name, provider: provider}) } if len(providers) == 0 { providers = append(providers, struct { name string provider string }{name: "CPU", provider: "cpu"}) } return providers } func (e *sherpaEngine) Recognize(samples []float32) (string, error) { stream := sherpa.NewOfflineStream(e.recognizer) defer sherpa.DeleteOfflineStream(stream) stream.AcceptWaveform(16000, samples) e.recognizer.Decode(stream) result := stream.GetResult() return result.Text, nil } func (e *sherpaEngine) HardwareInfo() string { return e.hwInfo } func (e *sherpaEngine) Close() { if e.recognizer != nil { sherpa.DeleteOfflineRecognizer(e.recognizer) e.recognizer = nil } }